三秒语音就能克隆自己的声音 VALL-E-X 使用教程

仓库部署

仓库地址:https://github.com/Plachtaa/VALL-E-X

安装命令(python3.10.0)

git clone https://github.com/Plachtaa/VALL-E-X.git
cd VALL-E-X
pip install -r requirements.txt

启动命令

python -X utf-8 launch-ui.py

运行后会自动下载模型文件

2024-06-23T02:35:35.png

这里可能需要科x上w,不然下载会报错。也可以根据readme的提示手动下载checkpoint文件

启动后的界面

2024-06-23T05:19:54.png

克隆声音

序号1上传自己录制的音频,序号2起一个名称,点击make开始克隆

2024-06-23T05:22:16.png

克隆完成后,按下图操作,输入朗读文本,点击生成

2024-06-23T05:24:50.png

显卡加速

默认是用cpu,建议开启显卡加速使用gpu提升速度

先卸载原来的torch

pip uninstall torch torchvision torchaudio

重新安装,cu120表示cuda的版本

pip install torch torchvision torchaudio index-url https://download.pytorch.org/whl/cu121

windows查看cuda版本命令:nvcc --version

重新运行

python -X utf-8 launch-ui.py

现在就可以使用显卡加速了

声音处理

推荐几个声音处理工具

背景音分离:https://github.com/Anjok07/ultimatevocalremovergui
windows下载https://github.com/Anjok07/ultimatevocalremovergui/releases/download/v5.6/UVR_v5.6.0_setup.exe

2024-06-23T05:48:47.png

声音切片工具:https://github.com/flutydeer/audio-slicer
windows下载https://github.com/flutydeer/audio-slicer/releases

2024-06-23T05:48:23.png

参考

  • https://www.cnblogs.com/wuliytTaotao/p/11453265.html#%E6%9F%A5%E7%9C%8B-cuda-%E7%89%88%E6%9C%AC-1
  • https://www.youtube.com/watch?v=D8tFRIF92WY

欢迎关注破晓一代公众号,获取最新ai开源工具使用教程
破晓一代公众号

原文博客:https://blog.abyssdawn.com/archives/236.html

  • 9
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
1. GAN:GAN(Generative Adversarial Network)是一种人工智能算法,可以生成逼真的图像、视频、音频等内容。GAN由两个神经网络组成,一个生成器和一个判别器,生成器生成假数据,判别器判断真假数据,两个网络相互博弈,通过反复训练来提高生成器的生成能力。 2. Diffusion:Diffusion是一种生成模型,可以生成高质量的图像、音频和视频。Diffusion的核心思想是在像素级别上控制噪声的扩散,从而实现对生成样本的控制。 3. CLIP:CLIP(Contrastive Language-Image Pre-Training)是一种自然语言处理和计算机视觉的预训练模型,可以将文本和图像联系起来。CLIP通过对大量文本和图像进行预训练,实现文本和图像的语义对齐,从而可以用文本来指导图像生成。 4. Transformer:Transformer是一种用于自然语言处理的神经网络模型,可以处理序列数据。Transformer采用了自注意力机制,能够有效地捕捉序列中的长程依赖关系,因此在机器翻译、文本生成等任务中表现优异。 5. NERF:NERF(Neural Radiance Fields)是一种生成模型,可以从单张图像中重建出三维场景。NERF利用神经网络学习场景中每个点的光线辐射度,从而实现高质量的场景重建。 6. VALL-E:VALL-E是一种基于Transformer和CLIP的图像生成模型,可以根据文本描述生成逼真的图像。VALL-E通过对文本描述和图像进行语义对齐,实现图像的生成。 7. GPT系列:GPT(Generative Pre-trained Transformer)系列是一种自然语言处理的预训练模型,包括GPT、GPT-2、GPT-3等不同版本。GPT系列采用了Transformer架构,通过对大量文本进行预训练,可以实现文本生成、文本分类等任务。GPT-3还可以进行语言理解和推理,表现出惊人的智能水平。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值