开源的语音交互平台简介及对比

最新推荐文章于 2024-08-16 09:12:51 发布

哦卖糕

最新推荐文章于 2024-08-16 09:12:51 发布

阅读量2.5k

点赞数 2

文章标签：人工智能语音识别

本文链接：https://blog.csdn.net/omaigao/article/details/104197160

版权

本文介绍了常见的开源语音交互平台，包括CMU-Sphinx、HTK、Julius和RWTH ASR。CMU-Sphinx是一个由卡内基梅隆大学开发的系列语音识别系统，支持多种版本和平台。HTK是剑桥大学工程学院开发的用于语音识别和其他领域的工具包。Julius是高性能的双通道LVCSR系统，适用于实时识别。RWTH ASR工具箱则包含了先进的语音识别技术，由 RWTH Aachen 大学开发，支持多种组件和操作系统。

摘要由CSDN通过智能技术生成

开源的语音交互平台

以下是几款常见的开源的语音交互平台。

1. CMU-Sphinx

CMU-Sphinx也简称为Sphinx（狮身人面像），是卡内基 - 梅隆大学（ Carnegie Mellon University，CMU）开发的一款开源的语音识别系统，它包括一系列的语音识别器和声学模型训练工具。

Sphinx有多个版本，其中Sphinx1~3是C语言版本的，而Sphinx4是Java版的，另外还有针对嵌入式设备的精简优化版PocketSphinx。Sphinx-I 由李开复（Kai-Fu Lee）于1987年左右开发，使用了固定的HMM模型（含3个大小为256的codebook），它被号称为第一个高性能的连续语音识别系统（在Resource Management数据库上准确率达到了90%+）。Sphinx-II由Xuedong Huang于1992年左右开发，使用了半连续的HMM模型，其HMM模型是一个包含了5个状态的拓扑结构，并使用了N-gram的语言模型，使用了Fast lextree作为实时的解码器，在WSJ数据集上的识别率也达到了90%+。

Sphinx-III主要由Eric Thayer 和Mosur Ravishankar于1996年左右开发，使用了完全连续的（也支持半连续的）HMM模型，具有灵活的feature vector和灵活的HMM拓扑结构，包含可选的两种解码器：较慢的Flat search和较快的Lextree search。该版本在BN（98的测评数据集）上的WER（word error rat

最低0.47元/天解锁文章

哦卖糕

关注

2
点赞
踩
9

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫