1 Whisper模型,免费开源的语音识别模型
Whisper模型是OpenAI公开的语音识别模型。这是一个免费可商用的模型。
Whisper模型根据参数量来区分,有多个不同的版本,分别是tiny,base,small medium,large, large-v2, large-v3。
目前性能最好的是2023年11月7日发布的参数量为1550M的large-v3。
与large-v2相比,large-v3主要有以下改进:
- 使用了更多的训练数据进行训练,100万小时标注数据和400万小时无标注数据。
- 输入特征使用了128维的fbank(v2使用了80维fbank)。
- token增加了对粤语的支持。
- 误识率(Error rate)比large-v2降低了10%至20%。
图1. Whisper模型各种版本的比较
参考资料:https://huggingface.co/openai/whisper-large-v3