通过Python的speech_recognition库将音频文件转为文字

置顶空空star

已于 2023-06-28 10:21:19 修改

阅读量4.6k

点赞数 88

分类专栏：音视频文章标签：语音识别人工智能 python

于 2023-05-09 19:05:46 首次发布

本文链接：https://blog.csdn.net/weixin_38093452/article/details/130584997

版权

音视频专栏收录该内容

12 篇文章 7 订阅

订阅专栏

文章介绍了如何通过Python的speech_recognition库将音频文件转换为文字，包括音频准备、格式转换以及使用GoogleWebAPI进行语音识别的步骤。作者首先用gTTS生成了音频文件，然后将其转换为wav格式，最后利用Recognizer对象和recognize_google方法实现语音转文字。

摘要由CSDN通过智能技术生成

前言

大家好，我是空空star，本篇给大家分享一下通过Python的speech_recognition库将音频文件转为文字。
上一篇已经介绍了相关的库speech_recognition。

通过Python的speech_recognition库将音频文件转为文字

Python-语音转文字相关库介绍

一、音频准备

这里我们通过gTTS先生成一段音频，gTTS相关的介绍可以看博主之前写的博客。

通过Python的gtts库将文字转为音频

from gtts import gTTS
local = '/Users/kkstar/Downloads/video/'
text = '大家好，我是空空star，本篇给大家分享一下音频转文字，这是通过speech_recognition转换的文字。'
language = "zh-cn"
tts = gTTS(text=text, lang=language)
tts.save(local+"audio_gtts_0509.mp3")

二、音频声音

音频转文字_0509

三、格式转换

mp3转为wav。
这里不能只改后缀，需要用音频转换工具转换下。
audio_gtts_0509.mp3->audio_gtts_0509.wav

四、音频转文字

1.引入库

import speech_recognition as sr

2.定义音频路径

local = '/Users/kkstar/Downloads/video/'

3.创建一个Recognizer对象

r = sr.Recognizer()

4.打开音频文件，将音频文件读入Recognizer对象

音频文件必须是wav的格式

# 打开音频文件
with sr.AudioFile(local+'audio_gtts_0509.wav') as source:
    # 将音频文件读入Recognizer对象
    audio = r.record(source)

5.尝试使用Google Web API将语音转换为文字

try:
text = r.recognize_google(audio, language=‘zh-CN’)
print(‘转换结果：’, text)
except sr.UnknownValueError:
print(‘无法识别语音’)
except sr.RequestError as e:
print(‘无法连接到Google Web API. {0}’.format(e))