Qwen2-Audio是由阿里巴巴集团研发的一款大型音频语言模型。
Qwen2-Audio应用技术包括多模态输入处理、预训练与微调、注意力机制、条件文本生成、编码器-解码器架构以及Transformer架构。
Qwen2-Audio支持直接语音输入和多语言文本输出,具备语音聊天和音频分析两大功能,并支持超过8种语言,包括中文、英语、粤语、法语等。
Qwen2-Audio的特点是能够接受音频和文本输入,并生成文本输出,无需通过自动语音识别模块即可进行语音聊天,同时能够根据文本指令分析音频信息,包括语音、声音、音乐等。
在性能测试方面,Qwen2-Audio在多个主流基准测试中表现优异,尤其是在语音识别和翻译的准确性上,超越了OpenAI的Whisper-large-v3。
其中github项目地址为:https://github.com/QwenLM/Qwen2-Audio。
一、环境安装
1、python环境
建议安装python版本在3.10以上。
2、pip库安装
pip install torch==2.3.0+cu118 torchvision==0.18.0+cu118 torchaudio==2.3.0 --extra-index-url https://download.pytorch.org/whl/cu118
pip install git+https://github.com/huggingface/transformers
pip install -r requirements_web_demo.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
3、