大语言模型
文章平均质量分 75
夜雨飘零1
少年应有鸿鹄志,当骑骏马踏平川。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
仅需几秒音频钟即可克隆语音合成
本项目介绍了一个基于NeuTTS Air的快速语音克隆系统,用户可通过简短音频样本克隆任意语音。系统支持Windows/Linux/MacOS平台,提供GUI界面和HTTP服务接口两种使用方式,支持中文等多种语言,并能通过微调适配个性化需求。项目包含完整的环境搭建指南、音频克隆流程说明、微调模型方法以及可视化操作界面演示,用户可选择CPU或GPU进行推理,仅需3-15秒的干净音频样本即可实现高质量语音克隆。原创 2025-11-01 18:45:00 · 1932 阅读 · 0 评论 -
NeuCodec-基于神经模型对音频极限压缩
NeuCodec是一种基于有限标量量化(FSQ)的低比特率(0.8kbps)音频编解码器,专为语音标记化设计。它可以将263KB的16kHz WAV文件压缩至仅2KB(压缩率100倍),同时支持还原为24kHz音频。该工具适用于训练高质量文本转语音模型的研究者,安装简单(pip install neucodec),提供编码和解码功能,并支持ONNXRuntime加速CPU解码。开源地址和论文分别位于Github(neuphonic/neucodec)和arXiv平台。原创 2025-11-01 10:05:40 · 445 阅读 · 0 评论 -
使用SenseVoice-Small搭建语音识别界面应用和服务
本文介绍了SenseVoice-Small多语言音频理解模型的使用方法,该模型支持语音识别、情感识别、声学事件检测等功能,涵盖中文、粤语、英语等多种语言。文章提供了Python代码示例展示如何快速实现语音识别,并重点介绍了配套的GUI界面工具和API服务。GUI工具支持音频/视频文件识别,可输出带时间戳的文本结果并导出为字幕文件;API服务则为其他设备调用提供接口。项目还包含网页测试界面,支持查看分段识别结果和导出多种格式字幕文件。源码可通过知识星球获取。原创 2025-10-17 21:18:50 · 1090 阅读 · 0 评论 -
白嫖AiStudio算力部署文心4.5开源大模型给Android调用
摘要 本文介绍了如何利用AiStudio平台免费算力部署文心4.5开源大模型,并搭建中转服务供Android设备调用。主要步骤包括:1) 在AiStudio注册并选择ERNIE-4.5-21B-A3B-Paddle模型进行部署;2) 获取API Key和base_url后,修改中转服务的OpenAI客户端配置;3) Android端通过HTTP请求访问中转服务,实现流式对话功能。该方法无需自有GPU服务器,降低了使用门槛,保持了与上一篇文章相同的Android调用方式。原创 2025-07-03 21:59:58 · 822 阅读 · 0 评论 -
部署文心4.5开源模型给Android设备调用
本文介绍了在Android端调用部署的文心4.5大语言模型的方法。首先通过fastdeploy部署ERNIE-4.5-21B-A3B-Paddle模型并启动API服务,然后编写Python中转服务处理对话历史并转发请求。Android客户端通过OkHttp发送请求到中转服务,实时接收流式响应数据,实现打字机效果的对话界面。文中提供了完整的部署步骤、服务端代码和Android核心调用方法,展示了如何将大模型能力集成到移动应用中。原创 2025-07-02 21:54:53 · 559 阅读 · 0 评论 -
文心4.5开源大模型的使用和部署
百度文心4.5系列大模型正式开源,包含10款不同规模的模型(0.3B到424B参数)。本文介绍了快速部署和使用方法:1)安装PaddlePaddle、FastDeploy等必要环境;2)提供Python代码示例实现本地对话功能;3)讲解如何启动API服务并兼容OpenAI接口格式。通过简单命令即可部署模型服务(默认端口8180),并支持使用标准openai库进行调用。文章还预告后续将补充Android客户端调用方法,为开发者提供完整的端到端解决方案。原创 2025-06-30 22:59:47 · 1260 阅读 · 7 评论 -
快速从零部署一个DeepSeek-R1服务
这里使用最简单的几条命令介绍如何部署DeepSeek-R1的服务,默认已经安装了Anaconda,使用的是vllm框架,国内也可以轻松部署。原创 2025-04-05 14:44:18 · 494 阅读 · 0 评论 -
基于大语言模型实现文本端点检测
在语音对话识别中,一般使用VAD检测用户时候结束说话,但是这个结束时间长度设置多少合适,这很难抉择,太短了,用户说话慢就容易打断,太长了用户等待时间久。还有常见的情况,用户在说话的时候,中途停顿了一下思考,如果只是使用VAD检测,有可能就会认为说话结束,但是用户还没有说话,这句话也不完整。这种情况可以配合文本端点检测,在使用VAD检测的时候,配合文本端点检测,从而保证用户表达完整。原创 2025-01-18 14:14:00 · 1140 阅读 · 0 评论
分享