openSMILE是一款专门为提取音频特征设计的软件,介绍和安装方法网上已经有很多,这里不再赘述,我摸索openSMILE的使用方法的时候发现网上关于这个软件的教程很少,所以将自己使用的经验写出来放到这个博客上来,希望有人使用这个软件的时候不要再绕那么多弯路。
我安装软件的时候跟visual studio不停地冲突,所以我尝试了一下安装到mac系统上,并且使用shell编写程序脚本,进行特征的提取。
在使用openSMILE的时候,决定了你提取的特征的参数都存储在你所使用的.config文件中,包括了frame size, mfcc的系数的数量,是否包含delta等,小白完全可以在官方提供的配置文件上进行修改,提取自己模型所需的特征值。
在openSMILE中,默认提取后存储的文件格式为compatibility HTK format,在python中我没有找到很合适的function读取这种文件类型,最终我使用的是MATLAB的voice tool 包中的readhtk()
函数。具体的模型建立方法我将在下一篇博客中说明。
现在我们先来看一下官方提供的配置文件MFCC12_0_D_A.conf
。
///////////////////////////////
///// > openSMILE configuration file to extract MFCC features < //////
///// HTK target kind: MFCC_0_D_A, numCeps=12 //////////
///// //////
///// (c) 2013-2016 audEERING. //////////
///// All rights reserverd. See file COPYING for details. //////
////////////////