Python开发之路(2)— 使用百度API实现语音识别

Python开发之路(2)— 使用百度API实现语音识别

一、在百度智能云创建语音识别应用

打开百度智能云:https://cloud.baidu.com/
登录控制台,选择语音技术:
在这里插入图片描述
然后点击创建应用
在这里插入图片描述
然后输入应用名称名称、选择应用类型,接口选择默认即可,输入描述,然后点击立即创建即可
在这里插入图片描述
然后我们就可以看到创建好的应用
在这里插入图片描述

二、获取Access Token

首先导入requests包:

import requests

然后使用过程创建的项目的API Key和Secret_Key获取Access Token
在这里插入图片描述

    API_Key = "DF2wS4DQ53TlS8ATxasy0ZXv"            # 官网获取的API_Key
    Secret_Key = "GvADiMXnwATEhaiKuOXg3t37KnKClGWr" # 为官网获取的Secret_Key
    #拼接得到Url
    Url = "https://aip.baidubce.com/oauth/2.0/token?grant_type=client_credentials&client_id="+API_Key+"&client_secret="+Secret_Key
    resp = request.urlopen(Url)
    if resp:
        result = json.loads(resp.read().decode('utf-8'))
        print(result)
        # 打印access_token
        print(result['access_token'])
        # 打印有效期
        print(result['expires_in']/(60*60*24),"days")

运行,可以得到
在这里插入图片描述
我们将其封装成一个函数:

def get_token():
    API_Key = "DF2wS4DQ53TlS8ATxasy0ZXv"            # 官网获取的API_Key
    Secret_Key = "GvADiMXnwATEhaiKuOXg3t37KnKClGWr" # 为官网获取的Secret_Key
    #拼接得到Url
    Url = "https://aip.baidubce.com/oauth/2.0/token?grant_type=client_credentials&client_id="+API_Key+"&client_secret="+Secret_Key
    try:
        resp = request.urlopen(Url)
        result = json.loads(resp.read().decode('utf-8'))
        # 打印access_token
        print("access_token:",result['access_token'])
        return result['access_token']
    except request.URLError as err:
        print('token http response http code : ' + str(err.code))

三、通过Post将上传音频文件,获得语言识别结果

通过查阅百度语音识别的技术文档,我们有两种方法将文件上传:
在这里插入图片描述
因为第二种更简单,我们使用第2种方法,首先打开我们需要识别的音频文件,获取里面的数据

    # 打开需要识别的语音文件
    speech_data = []
    with open("01.wav", 'rb') as speech_file:
        speech_data = speech_file.read()
    length = len(speech_data)
    if length == 0:
        print('file 01.wav length read 0 bytes')

我们将Url里的参数设置好:

    # 3、设置Url里的参数
    params = {'cuid': "12345678python", # 用户唯一标识,用来区分用户,长度为60字符以内。
              'token': token,           # 我们获取到的 Access Token
              'dev_pid': 1537 }         # 1537 表示识别普通话
    # 将参数编码
    params_query = parse.urlencode(params)
    # 拼接成一个我们需要的完整的完整的url
    Url = 'http://vop.baidu.com/server_api' + "?" + params_query

然后我们设置header,即请求头,我们使用的文件格式为wav,百度语音识别只支持16000采样率

    # 4、设置请求头
    headers = {
        'Content-Type': 'audio/wav; rate=16000',    # 采样率和文件格式
        'Content-Length': length
    }

这样就可以发送post请求了,将音频数据直接放在body中就好

    # 5、发送请求,音频数据直接放在body中
    # 构建Request对象
    req = request.Request(Url, speech_data, headers)
    # 发送请求
    res_f = request.urlopen(req)
    # 打印结果
    result = json.loads(res_f.read().decode('utf-8'))
    print(result)
    print("识别结果:",result['result'][0])

录音程序可以参考上一篇博客:Python开发之路(1)— 使用Pyaudio进行录音和播音
不过要注意百度语音识别的对文件的要求
在这里插入图片描述
运行程序,可以看到,返回了识别到的结果
在这里插入图片描述
最后贴上完整代码:

#!/usr/bin/env python
# -*- coding:utf-8 -*-
# Author: William

# encoding:utf-8

import json
from urllib import request,parse

def get_token():
    API_Key = "DF2wS4DQ53TlS8ATxasy0ZXv"            # 官网获取的API_Key
    Secret_Key = "GvADiMXnwATEhaiKuOXg3t37KnKClGWr" # 为官网获取的Secret_Key
    #拼接得到Url
    Url = "https://aip.baidubce.com/oauth/2.0/token?grant_type=client_credentials&client_id="+API_Key+"&client_secret="+Secret_Key
    try:
        resp = request.urlopen(Url)
        result = json.loads(resp.read().decode('utf-8'))
        # 打印access_token
        print("access_token:",result['access_token'])
        return result['access_token']
    except request.URLError as err:
        print('token http response http code : ' + str(err.code))

def main():
    # 1、获取 access_token
    token = get_token()
    # 2、打开需要识别的语音文件
    speech_data = []
    with open("01.wav", 'rb') as speech_file:
        speech_data = speech_file.read()
    length = len(speech_data)
    if length == 0:
        print('file 01.wav length read 0 bytes')

    # 3、设置Url里的参数
    params = {'cuid': "12345678python", # 用户唯一标识,用来区分用户,长度为60字符以内。
              'token': token,           # 我们获取到的 Access Token
              'dev_pid': 1537 }         # 1537 表示识别普通话
    # 将参数编码
    params_query = parse.urlencode(params)
    # 拼接成一个我们需要的完整的完整的url
    Url = 'http://vop.baidu.com/server_api' + "?" + params_query

    # 4、设置请求头
    headers = {
        'Content-Type': 'audio/wav; rate=16000',    # 采样率和文件格式
        'Content-Length': length
    }

    # 5、发送请求,音频数据直接放在body中
    # 构建Request对象
    req = request.Request(Url, speech_data, headers)
    # 发送请求
    res_f = request.urlopen(req)
    result = json.loads(res_f.read().decode('utf-8'))
    print(result)
    print("识别结果:",result['result'][0])

if __name__ == '__main__':
    main()
  • 7
    点赞
  • 39
    收藏
    觉得还不错? 一键收藏
  • 2
    评论
### 回答1: 要使用Python调用百度API实现语音识别需要先注册百度开发者账号并创建应用获取API KeySecret Key。然后安装Python百度AI SDK,使用SDK提供的语音识别接口,将语音文件上传到百度服务器进行识别,最后将识别结果返回给Python程序。具体实现步骤可以参考百度AI SDK的官方文档。 ### 回答2: Python是一种开源、高级、解释型编程语言,在人工智能这一领域表现出了强大的应用能力,其中调用百度API实现语音识别Python的一个应用场景。 百度语音识别API是基于深度学习的中文普通话语音识别技术,其提供了语音转文字的功能,可应用于智能语音助手、语音翻译、语音识别等领域。Python调用百度API实现语音识别的主要步骤如下: 1.获取API访问密钥 在百度智能云控制台中开通百度语音识别服务,并生成API KeySecret Key。 2.安装Python SDK并调用API 使用Python SDK,安装百度AI SDK,并编写代码。示例代码如下: ``` import sys import json import uuid from aip import AipSpeech app_id = '[app_id]' # 在智能云中申请的app_id api_key = '[api_key]' # 在智能云中申请的api_key secret_key = '[secret_key]' # 在智能云中申请的secret_key client = AipSpeech(app_id, api_key, secret_key) def get_file_content(filePath): with open(filePath, 'rb') as fp: return fp.read() def recognize_speech(file_path): speech = get_file_content(file_path) res = client.asr(speech, 'pcm', 16000, { 'dev_pid': 1536, }) if res and 'result' in res: return res['result'][0] if __name__ == "__main__": file_path = "[path to your audio file]" text = recognize_speech(filePath) print(text) ``` 3.测试 运行代码,输出语音文件中的文字,检查语音识别是否成功。如果识别准确率不高,可以调整API参数或尝试其他语音识别引擎,以提高识别效果。 总之,Python调用百度API实现语音识别不仅方便快捷,还可以应用于很多实际场景,如智能家居、车载导航、航空管制等等。随着人工智能技术的不断发展,Python作为AI领域的主力编程语言之一,将继续发挥重要作用。 ### 回答3: Python作为一种简单易用、开发效率高的编程语言,在语音识别领域有着广泛的应用。而百度语音识别技术就是基于人工智能技术,可以将人类语音转换为相应的文字,它可以帮助用户快速实现语音输入、语音搜索、语音识别等功能。下面将详细介绍如何使用Python调用百度API实现语音识别。 第一步:准备百度语音识别API 在开始之前,需要百度AI开放平台申请一个应用程序,申请过程不难。在申请之后,可以得到一个App IDAPI KeySecret Key,这三个参数是调用百度语音API的必须参数,并且需要保密,以免泄露。 第二步:安装Python语音识别库 在Python中,有很多语音识别库可以选择,比如SpeechRecognition、PyAudio、PocketSphinx等,这里我们选择使用SpeechRecognition库,因为它支持多种语音识别API。 可以通过pip命令来安装SpeechRecognition: pip install SpeechRecognition 如果想要使用其他库,只需要替换其中的引入语句和对应的方法即可。 第三步:编写Python代码 import speech_recognition as sr # 将语音文件传递给语音识别器 r = sr.Recognizer() with sr.AudioFile('test.wav') as source: audio_data = r.record(source) # 通过语音识别API获取转换结果 key = 'API Key' secret = 'Secret Key' r = sr.Recognizer() with sr.AudioFile('test.wav') as source: audio_data = r.record(source) result = r.recognize_baidu(audio_data, key, secret) print(result) 以上是代码的基本结构,其中: - 第1行引入了SpeechRecognition库; - 第4-6行读取音频文件,将其转换为能够被语音识别器处理的格式; - 第9-11行调用百度语音识别API,将语音转换成文字,并返回相应的结果; - 第14行输出识别结果。 第四步:运行Python代码 在代码编辑器中,输入以上代码,保存到一个.py文件。将要进行语音识别的音频文件放到与这个.py文件同一目录下,然后在命令行中运行: python filename.py 其中filename.py是文件名。当然,也可以选择集成开发环境,比如PyCharm、Visual Code等。 总结 通过Python调用百度语音API实现语音识别,不仅能够提高工作效率,而且也可以更方便地实现语音输入、语音搜索、语音命令等功能。只需要按照以上步骤,就可以完成基于Python语音识别任务。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值