从语音识别的HMM模型的解码到Viterbi算法的Token Passing实现

最新推荐文章于 2024-05-27 17:36:11 发布

永无乡

最新推荐文章于 2024-05-27 17:36:11 发布

阅读量6.1k

点赞数 4

分类专栏：语音识别文章标签：语音识别 HMM Viterbi 解码

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/JosephPai/article/details/80522367

版权

本文介绍了语音识别的基本原理和HMM模型，重点讲解了Viterbi算法在解码过程中的应用，特别是Token Passing方法如何解决连续词识别问题。通过Token Passing，算法可以有效地寻找最佳路径并记录边界信息，实现高效的语音识别。

摘要由CSDN通过智能技术生成

1 从语音识别说起

语音识别是什么，通俗来说，就是输入音频，输出识别文字结果。基本方程如下
这里写图片描述
：识别结果
W：任一单词（以孤立词举例说明）
O：输入的语音序列（Observation Sequence）

上述方程的变换应用了Bayes Rule.

等式右边是两项乘积，P(W)来自语言模型（Language Model， LM），常用的模型有 N-gram。 P(O | W)来自于声学模型（Acoustic Model， AM），传统的语音识别系统普遍采用的是基于GMM-HMM的声学模型，其中GMM用于对语音声学特征的分布进行建模，HMM则用于对语音信号的时序性进行建模。具体介绍网上有很多通俗易懂的文章，这里暂不赘述。本文重点讲解声学模型中的解码问题，暂不涉及语言模型。

2 计算P(O | W) —— 解码

P(O | W)可以继续分解如下
P(O | W) = P(A, O | W) 这里写图片描述
其中A表示状态序列，O表示观测序列，a表示转移概率，b表示观测概率

如图，上方是状态序列（state sequence）（HMM），下方是观测序列（observation sequence）。我们看到，states之间存在不同的转移方式，每个state针对observation也有不同generate方式。可以想象，通过组合，我们可以得到一个巨大的状态网络。而我们语音识别的任务，通俗来说就是从这个巨大的状态网络中搜索到最佳路径（partial path），也就是最大概率的路径，对应上面公式的argmax。这个搜索匹配的过程在语音识别中叫做解码（decode）

最低0.47元/天解锁文章

关注

4
点赞
踩
18

收藏

觉得还不错? 一键收藏
6
评论
从语音识别的HMM模型的解码到Viterbi算法的Token Passing实现

1 从语音识别说起语音识别是什么，通俗来说，就是输入音频，输出识别文字结果。基本方程如下：识别结果 W：任一单词（以孤立词举例说明） O：输入的语音序列（Observation Sequence）上述方程的变换应用了Bayes Rule.等式右边是两项乘积，P(W)来自语言模型（Language Model， LM），常用的模型有 N-gram。 P(O...
复制链接

扫一扫

专栏目录

评论 6

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。