【新手基础教程】音频处理之关键词识别

最新推荐文章于 2024-08-19 10:14:15 发布

猪百岁儿

最新推荐文章于 2024-08-19 10:14:15 发布

阅读量2k

点赞数

文章标签：算法 python 人工智能 linux java

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/xuguoliang757/article/details/118963497

版权

本文档介绍了如何在MaixPy环境中进行孤立词识别，包括使用示例代码、模块调用流程和词汇模板的创建与识别。通过预处理、特征提取和动态时间弯折算法进行模板匹配，实现基于STM32的语音识别。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

isolated word

本文档在 MaixPy 0.5.1_128 minimum_speech_with_ide_support 固件测试通过，使用前请确保硬件录音功能可用。

这是一个孤立词识别的算法模块,用户通过录音生成词汇模板加载到模块中，再通过它识别到用户加载的词汇模板，并返回匹配的可能性，实现请参考基于STM32的孤立词语音识别。

孤立词识别

按照语音发音方式来分，有孤立词识别、连接词识别、连续语音识别 3 种；所谓孤立词识别（Isolated Word Recognition）是指在发待识别音时，每次只含词汇表中的一个词条。
词汇模板

我们将一段用人声说出的词汇录音下来，通过算法制作成可识别的模板，称为词汇模板。
模板匹配

假设算法模块加载了词汇模板，我们通过录音输入数据给算法模块后，它会进行内部匹配得到最有可能的识别结果。

本模块具体识别流程是：预滤波、ADC、分帧、端点检测、预加重、加窗、特征提取、特征匹配。端点检测(VAD)采用短时幅度和短时过零率相结合。检测出有效语音后，根据人耳听觉感知特性，计算每帧语音的Mel频率倒谱系数(MFCC)。然后采用动态时间弯折(DTW)算法与特征模板相匹配，最终输出识别结果。

1. 如何使用？

目前硬件支持程度：

最低0.47元/天解锁文章

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。