快速识别音频文件转成文字

易道云之逍遥峰

于 2024-07-30 15:12:55 发布

阅读量167

点赞数 7

文章标签：人工智能语音识别

本文链接：https://blog.csdn.net/mopmgerg54mo/article/details/140796503

版权

一、SenseVoice概述

阿里云通义千问开源了两款语音基座模型 SenseVoice（用于语音识别）和 CosyVoice（用于语音生成）。

SenseVoice 专注于高精度多语言语音识别、情感辨识和音频事件检测，有以下特点：

多语言识别：采用超过 40 万小时数据训练，支持超过 50 种语言，识别效果上优于 Whisper 模型
富文本识别：具备优秀的情感识别，能够在测试数据上达到和超过目前最佳情感识别模型的效果；支持声音事件检测能力，支持音乐、掌声、笑声、哭声、咳嗽、喷嚏等多种常见人机交互事件进行检测
高效推理： SenseVoice-Small 模型采用非自回归端到端框架，推理延迟极低，10s 音频推理仅耗时 70ms，15 倍优于 Whisper-Large
微调定制：具备便捷的微调脚本与策略，方便用户根据业务场景修复长尾样本问题
服务部署：具有完整的服务部署链路，支持多并发请求，支持的客户端语言有 python、c++、html、java 与 c#等

体验地址：魔搭社区

二、本地测试

1、项目源码克隆

git clone https://gitee.com/zhyqieqie/SenseVoice.git

2、安装依赖

pip install -i https://pypi.tuna.tsinghua.edu.cn/simple -r requirements.txt

3、测试

vi test.py

test.py内容（加载线上的一个音频文件并且自动解析出文件的文字）：

from model import SenseVoiceSmall

model_dir = "iic/SenseVoiceSmall"
m, kwargs = SenseVoiceSmall.from_pretrained(model=model_dir)


res = m.inference(
    data_in="https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/test_audio/asr_example_zh.wav",
    language="auto", # "zn", "en", "yue", "ja", "ko", "nospeech"
    use_itn=False,
    **kwargs,
)

print(res)

python test.py

初次运行的时候，会自动拉取模型文件，下一次运行就会直接加载本地模型文件。

易道云之逍遥峰

关注

7
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
快速识别音频文件转成文字

"SenseVoice"在多个开源基准数据集上进行了性能测试，与Whisper模型相比，在中文和粤语识别上显示出明显的优势。情感识别方面，"SenseVoice"在未经目标数据微调的情况下，也能超越当前最佳模型。事件检测方面，尽管主要针对语音数据训练，"SenseVoice"也能在环境音分类任务上取得良好效果。
复制链接

扫一扫