零基础入门语音识别-食物声音识别
Task6 语音识别基础知识介绍
本次新人赛是Datawhale与天池联合发起的零基础入门系列赛事第八场 —— 零零基础入门语音识别-食物声音识别挑战赛。
baseline由开源学习组织Datawhale提供
https://github.com/datawhalechina/team-learning
不知不觉,这次学习的尾声已经到来,在进行最后的学习总结前,我先回顾了一边此前学习的内容。
零基础入门语音识别-食物声音识别Task1
零基础入门语音识别-食物声音识别Task2
零基础入门语音识别-食物声音识别Task3
零基础入门语音识别-食物声音识别Task4
零基础入门语音识别-食物声音识别Task5
语音识别基础与发展
其实,在日常生活里,语音识别的应用已经十分多样,听歌识曲、语言识别,声纹解锁等功能让声音的力量更进一步。
语音识别基础
语音识别全称为“自动语音识别”,Automatic Speech Recognition (ASR), 一般是指将语音序列转换成文本序列。语音识别最终是统计优化问题,给定输入序列O={O1,…,On},寻找最可能的词序列W={W1,…,Wm},即寻找使得概率P(W|O)最大的词序列。用贝叶斯公式表示为:
其中P(O|W) 叫做声学模型,描述的是给定词W时声学观察为O的概率;P(W)叫做语言模型,负责计算某个词序列的概率;P(O)是观察序列的概率,是固定的,是固定的,所以只看分母部分即可。
语音识别的发展
传统机器学习,基于统计的GMM-HMM,其中HMM (隐马尔可夫模型,Hidden Markov Model)用来描述信号动态特性(即语音信号相邻帧间的相关性),GMM(高斯混合模型,Gaussian Mixed Model)用来描述HMM每个状态的静态特性(即HMM每个状态下语音帧的分布规律);
与深度学习结合,DNN-RNN、DNN-HMM,可引入LSTM(长短期记忆网络,Long Short-Term Memory),DNN(深度学习网络,Deep Neural Networks),RNN(循环神经网络,Recurrent Neural Network);
迁移学习(Transfer learning)算法、以及注意力(Attention)机制的基于语音频谱图的CNN(卷积神经网络,Convolutional Neural Network)模型的兴起。
学习总结
第一次参加这类型的比赛,也第一次发现,原来工作中的人或是在忙碌的人,面对自己喜欢的事物,都在努力着,在群里的各路大牛,看直播时的醍醐灌顶,成为大学生差不多一年了,第一次有以前那种学习的兴奋感,而不是功利性的。
我希望再接下来的日子里,可以打好基础,将喜欢的事物完成。