MFCC特征提取学习笔记

本文介绍了MFCC特征提取过程,包括预加重以增强高频信号,分帧利用语音的短时平稳性,加窗确保信号周期性,快速傅里叶变换实现时域到频域转换,Mel滤波模拟人耳听觉特性,以及离散余弦变换得到MFCC系数。
摘要由CSDN通过智能技术生成

MFCC特征提取学习笔记


做毕设的过程中接触到了语音识别,对MFCC特征提取的步骤有一些粗浅的理解,如有理解错误的地方,请前辈们指出。

  1. 预加重
    由于人在发声的过程中存在唇端辐射,会造成语音的高频信号比中频和低频信号弱。预加重的目的就是突出语音信号中高频部分的能量。预加重通过一个高通滤波器实现: H ( z ) = 1 − μ z − 1 H(z) = 1 - \mu z^{-1} H(z)=1μz1 μ \mu μ称作预加重系数,可以取0.9~1之间的值。
    高通滤波器可以使高于某一值的信号通过,而使低于临界值的信号被削弱或者阻隔,所以它最终的效果不仅突出了语音信号的高频部分,还提升了语音信号的信噪比。预加重前后的波形图中振幅得到突出的部分就是语音信号的高频部分,同时语音的背景噪声也得到了削弱。
    在这里插入图片描述
  2. 分帧
    分帧是为了利用语音信号的短时平稳性,即假设语音信号在足够短的时间内是平稳的。这里的图是取帧长25毫秒,帧移10毫秒进行分帧的结果图。帧长是指每一帧的长度,帧移是相邻帧起始点的间隔。这里帧与帧之间的重叠为15毫秒,超过了帧长的一半。

在这里插入图片描述
3. 加窗
由于下一步是快速傅里叶变换,而快速傅里叶变换要求信号具有周期性。分帧得到的信号首尾不连续,所以通过汉明窗(汉明窗可以使窗边界处信号平滑衰减)使信号首尾连续,可以被视作一个周期性的信号。由于信号首尾衰减意味着信息的丢失,分帧时帧与帧之间的重叠超过帧长的一半是为了弥补这一部分的信息损失。
汉明窗函数: ω ( x ) = { 0.54 − 0.46 cos ⁡ ( 2 π n N − 1 ) 0 ≤ n ≤ N − 1 1 others \omega(x) = \begin{cases} 0.54-0.46 \cos(\frac{2\pi n}{N-1})&0\leq n \leq N-1\\1&\text{others}\end{cases} ω(x)={ 0.540.46cos(N12πn)10nN1others

  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
### 回答1: MFCC(Mel频率倒谱系数)特征提取是语音信号处理中常用的一种特征提取方法。它利用人耳对不同频率声音的感知特性,将频域上的能量分布转化为梅尔频率,然后使用倒谱分析的方法提取特征。MFCC提取了语音信号的频谱包络特征,具有良好的区分能力,适合于语音识别中的特征提取。 在Python中,可以使用第三方库librosa来进行MFCC特征提取。首先需要读取音频文件并进行预处理,例如去噪、去静音等。然后使用librosa提供的mfcc函数,对音频信号进行处理,得到MFCC特征矩阵。可以通过调整函数参数,如采样率、帧长、帧移、梅尔带宽等,来优化特征提取效果。 MFCC特征提取后,一般需要进行降维处理以减少特征维度、节省计算量。可以使用PCA(主成分分析)等方法对MFCC特征矩阵进行降维。 在语音识别中,MFCC特征提取是特征工程中非常重要的一部分。它可以提取语音信号的韵律、音色、共振等特征,为后续分类识别提供优良的特征向量,进而提高识别准确率。在实际应用中,可以将MFCC特征与深度学习等算法相结合,构建高效的语音识别系统。 ### 回答2: MFCC即梅尔频率倒谱系数,是语音信号处理中常用的一种特征提取方法。MFCC特征提取有助于降低音频信号的维度和复杂度,使其更易于处理。在Python中,可以使用Librosa库轻松地实现MFCC特征提取。 使用Librosa库进行MFCC特征提取的步骤如下: 1. 导入Librosa库。 ``` python import librosa ``` 2. 读取音频文件。 ``` python audio_data, sample_rate = librosa.load('audio_file.wav') ``` 这里的audio_file.wav是待处理的音频文件。 3. 计算MFCC系数。 ``` python mfccs = librosa.feature.mfcc(y=audio_data, sr=sample_rate, n_mfcc=13) ``` 这里的n_mfcc是要计算的MFCC系数个数,一般取13。 4. 对MFCC系数进行归一化处理。 ``` python mfccs_normalized = sklearn.preprocessing.scale(mfccs, axis=1) ``` 这里使用了sklearn库中的preprocessing模块进行归一化处理。 5. 可以将MFCC系数可视化。 ``` python import matplotlib.pyplot as plt plt.figure(figsize=(10, 4)) librosa.display.specshow(mfccs_normalized, sr=sample_rate, x_axis='time') plt.colorbar() plt.title('MFCC') plt.tight_layout() plt.show() ``` 以上步骤完成后,就可以得到一个包含MFCC系数的矩阵。这个矩阵可以用于音频信号分类、语音识别等任务。 总之,MFCC特征提取可以在语音信号处理中起到很好的作用。在Python中,使用Librosa库可以轻松实现MFCC特征提取,同时使用sklearn库中的preprocessing模块可以轻松实现归一化处理。 ### 回答3: MFCC(Mel频率倒谱系数)是一种在语音识别领域经常使用的特征提取方式,它能够将语音信号转化为一组数值特征,以便进行进一步的分析和处理。在python语音处理的库中,可以利用librosa库和python_speech_features库来进行MFCC特征提取。 利用librosa库进行MFCC特征提取 可以使用librosa库的mfcc()函数来实现MFCC特征提取。该函数需要传入语音信号与采样率,可以返回一个二维的矩阵,表示从语音信号中提取的MFCC特征。 下面是一个利用librosa库进行MFCC特征提取的例子: ``` import librosa import librosa.display import numpy as np import matplotlib.pyplot as plt # Load audio file y, sr = librosa.load('speech.wav') # Extract MFCC feature mfcc_feat = librosa.feature.mfcc(y=y, sr=sr, n_mfcc=13) # Plot MFCC feature plt.figure(figsize=(10, 4)) librosa.display.specshow(mfcc_feat, x_axis='time') plt.colorbar() plt.title('MFCC') plt.tight_layout() plt.show() ``` 在上面的例子中,“speech.wav”是要提取MFCC特征的语音文件名,将其加载为y和sr两个变量,其中y是语音信号,sr是采样率。使用librosa.feature.mfcc()函数,将语音信号和采样率作为参数传入,同时可以指定要提取的MFCC特征的个数。通过librosa.display.specshow()函数和plt.show()函数,可以将MFCC特征以图式显示出来。 利用python_speech_features库进行MFCC特征提取 python_speech_features库也提供了MFCC特征提取的函数mfcc()。与librosa库类似,该函数需要传入语音信号及其采样率,可以返回一个二维的矩阵,表示从语音信号中提取的MFCC特征。 下面是一个利用python_speech_features库进行MFCC特征提取的例子: ``` from python_speech_features import mfcc import scipy.io.wavfile as wav import numpy as np import matplotlib.pyplot as plt # Load audio file rate, sig = wav.read('speech.wav') # Extract MFCC feature mfcc_feat = mfcc(sig, rate, numcep=13) # Plot MFCC feature plt.figure(figsize=(10, 4)) plt.imshow(np.transpose(mfcc_feat), origin='lower', aspect='auto') plt.colorbar() plt.title('MFCC') plt.tight_layout() plt.show() ``` 在上面的例子中,利用scipy.io.wavfile库的read()函数将语音文件“speech.wav”加载为一个由采样率rate和信号sig组成的元组,再将sig和rate作为参数传入python_speech_features库的mfcc()函数中,指定要提取的MFCC特征的个数。通过Numpy库的transpose()函数和matplotlib库的imshow()函数,将MFCC特征以图式显示出来。 总结 MFCC是语音信号特征提取的常用方法之一,通过利用python的音频处理库,可以很方便地实现MFCC特征的提取。本文分别介绍了利用librosa库和python_speech_features库进行MFCC特征提取的方法,希望能对相关领域的学习者有所帮助。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值