基于MATLAB的说话人识别系统[在线录音，离线，GUI界面]

最新推荐文章于 2022-09-06 20:19:51 发布

「已注销」

最新推荐文章于 2022-09-06 20:19:51 发布

阅读量1.1k

点赞数 2

分类专栏：你好，MATLAB 文章标签：语音识别 matlab gui

本文链接：https://blog.csdn.net/m0_60115601/article/details/118897270

版权

该博客介绍了基于MATLAB的声纹识别系统，包括系统原理、梅尔频率倒谱系数（MFCC）和矢量量化技术的运用。通过预处理、特征提取和矢量量化，构建了一个声音锁或门禁系统。文章还提到了系统训练和识别过程，以及作者设计的GUI界面。

摘要由CSDN通过智能技术生成

一、课题介绍
该设计为基于MATLAB的声纹识别系统，也叫做说话人识别系统，也可以理解为声音锁或者声音门禁系统。我们知道，门禁的话，可以利用人脸，指纹，虹膜，本设计为采用声音识别的方法。
1 系统原理
a.声纹识别
这两年随着人工智能的发展，不少手机App都推出了声纹锁的功能。这里面所采用的主要就是声纹识别相关的技术。声纹识别又叫说话人识别，它和语音识别存在一点差别。

b.梅尔频率倒谱系数（MFCC）
梅尔频率倒谱系数（Mel Frequency Cepstrum Coefficient, MFCC）是语音信号处理中最常用的语音信号特征之一。
实验观测发现人耳就像一个滤波器组一样，它只关注频谱上某些特定的频率。人耳的声音频率感知范围在频谱上的不遵循线性关系，而是在Mel频域上遵循近似线性关系。
梅尔频率倒谱系数考虑到了人类的听觉特征，先将线性频谱映射到基于听觉感知的Mel非线性频谱中，然后转换到倒谱上。普通频率转换到梅尔频率的关系式为：

c.矢量量化（VectorQuantization）
本系统利用矢量量化对提取的语音MFCC特征进行压缩。
VectorQuantization (VQ)是一种基于块编码规则的有损数据压缩方法。事实上，在 JPEG 和 MPEG-4 等多媒体压缩格式里都有 VQ 这一步。它的基本思想是：将若干个标量数据组构成一个矢量，然后在矢量空间给以整体量化，从而压缩了数据而不损失多少信息。
3 系统结构
本文整个系统的结构如下图：
–训练过程
首先对语音信号进行预处理，之后提取MFCC特征参数，利用矢量量化方法进行压缩，得到说话人发音的码本。同一说话人多次说同一内容，重复该训练过程，最终形成一个码本库。
–识别过程
在识别时，同样先对语音信号预处理，提取MFCC特征，比较本次特征和训练库码本之间的欧氏距离。当小于某个阈值，我们认定本次说话的说话人及说话内容与训练码本库中的一致，配对成功。