实时智能应答3D数字人搭建

金双石的小墨

已于 2024-03-13 09:06:26 修改

阅读量1.8k

点赞数 25

分类专栏：神经网络文章标签：人工智能神经网络 gpt 实时数字人

于 2024-03-06 16:05:43 首次发布

本文链接：https://blog.csdn.net/selifecn/article/details/136509300

版权

本文介绍了FACEGOOD开源的语音驱动口型算法，该技术降低了AI数字人的开发门槛。通过FaceGoodLiveLink和会话精灵API，实现语音识别、对话和语音合成功能。详细阐述了实时语音识别、数据采集制作、神经网络训练等关键步骤，并提供了Unity中音频驱动面部BlendShape的方法。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

语音驱动口型的算法
先看效果：

你很快就可以帮得上我了

FACEGOOD 决定将语音驱动口型的算法技术正式开源，这是 AI 虚拟数字人的核心算法，技术开源后将大程度降低 AI 数字人的开发门槛。FACEGOOD是一家国际领先的3D基础软件开发商，研究领域涉及生物软组织模拟、运动科学、计算机图形学等，其核心产品软件AVATARY广泛应用于国内外影视动画、游戏、虚拟人应用场景的娱乐、文化、媒体等行业的3D数字内容制作，提供优秀的数字工程设计、娱乐软件服务和媒体娱乐行业和基础设施行业的产品和技术解决方案。 2022年6月28日，FACEGOOD（量子动力（深圳）计算机科技有限公司）作为国内首批企业以Principle Member身份正式加入Metaverse Standard Forum（元宇宙标准论坛）。

下载工程

git clone  https://github.com/FACEGOOD/FACEGOOD-Audio2Face.git

文件如下：

部署依赖

pip install PyAudio
pip install tensorflow
pip install websocket ,websocket-client

pyaudio库，使用这个可以进行录音，播放，生成wav文件等等。PyAudio 提供了 PortAudio 的 Python 语言版本，这是一个跨平台的音频 I/O 库，使用 PyAudio 你可以在 Python 程序中播放和录制音频。为PoTaTudio提供Python绑定，跨平台音频I/O库。使用PyAudio，您可以轻松地使用Python在各种平台上播放和录制音频.
PyAudio更多
相关版本如下：tersorflow-gpu 2.6
cudatoolkit 11.3.1 cudnn 8.2.1 scipy 1.7.1
python-libs：pyaudio 请求 websocket websocket-client

申请智能语音API接口
会话精灵（Ta