- 博客(387)
- 问答 (44)
- 收藏
- 关注
原创 WeNet语音识别实战
音之家-AI工匠学堂推出《WeNet语音识别实战》, WeNet是目前工业界最流行的开源端到端语音识别系统之一,也是学习端到端语音识别的最佳实践项目。语音识别的学习者和从业者,可以通过学习这门课程高效全面的掌握WeNet的基本原理和实战方法,降低自己摸索的成本,快速构建出高性能的语音识别系统。...
2022-06-21 15:06:58
7634
4
原创 离谱,OpenAI被Opus 5黑了!
更令人无语的是,关于这个漏洞的代码修改,其实去年就在开源社区的上有分支修复了,但由于没有被打上安全补丁的标签(未分配CVE编号),导致下游无数操作系统和软件根本不知道这件事!这就是现代互联网的脆弱性缩影:正如那幅著名的xkcd漫画所嘲讽的,所有现代数字基础设施,都摇摇欲坠地建立在某个不知名程序员维护的、满是漏洞的小型开源库之上。普通企业能凭借这种攻击成本门槛获得安全。因为要把一个理论上的内存损坏漏洞变成真正能攻入服务器的「武器」,需要极其罕见的专业知识、大量的时间投入、以及对目标环境的深度逆向工程。
2026-09-20 16:01:24
209
原创 迈向通用听觉智能:清华团队在《自然·机器智能》解析关键技术路径
近日,清华大学电子工程系联合Google DeepMind、NVIDIA、剑桥大学等机构的研究人员,在期刊《自然·机器智能》(Nature Machine Intelligence)发表题为《迈向通用听觉智能:机器的聆听与表达》(Towards general auditory intelligence for machine listening and speaking)的综述论文。
2026-09-20 14:34:28
299
原创 颜水成团队推出VoiceMem,语音领域首个零延迟“流式双脑”记忆架构来了!
VoiceMem并不试图直接回答“AI何时会成为Being”。它做的是更具体的⼀步:把“记忆必须跟上实时交互”从⼀个抽象设想,推进成可以实现、评测和持续优化的⼯程问题。如果说实时交互让Digital Being能够出现在⼈⾯前,那么记忆决定了它下⼀次出现时,还是不是“同⼀个它”。
2026-09-10 15:23:55
316
原创 面壁智能开源2B小钢炮!逼近人类水平,跑出端侧通用Agent雏形
来源丨新智元全球4B参数规模以下开源基座模型的新榜首,居然是一个2B模型!9月8日,面壁智能与OpenBMB正式开源新一代端侧「小钢炮」——MiniCPM5-2B。在国际权威基准Artificial Analysis Intelligence Index(AA榜单)的最新评测中,MiniCPM5-2B以23分的综合成绩登顶全球4B以下开源基座模型第一。更引人注目的是其在智能体任务上的断层式领先:在专门评测Agent能力的 Agentic Index指标上,MiniCPM5-2B斩获20分。
2026-09-10 14:22:25
173
原创 ACM Multimedia 2026丨语音情感识别不应该只回答 Happy / Sad:真正重要的还有“他是怎么对你说的”
进一步分析发现,四种 text-only configuration 都出现严重坍塌,但它们并没有塌向同一个类别:Omni-3B 大量预测 Impatient,Omni-7B 更偏向 Sarcastic,Instruct-3B 有 87% 的预测落在 Warm,而 Neutral 没有被任何 text-only configuration 预测出来。过去很多 Speech Emotion Recognition 的进步发生在模型侧:更好的 Speech Encoder、更大的 LLM、更大的训练数据。
2026-09-02 18:18:48
399
原创 圆满收官丨2026年CCF先进音频技术竞赛
当音乐通过扩音设备播放出来,由于喇叭本身的失真(如手机喇叭播出来的音乐低频损失,鼓声无力)、多喇叭发声的混响感(如演唱会场景),会让录制该场景的音乐音质下降,需要音乐修复(Music Restoration)技术来提升音乐音质。初赛采用客观评分制,针对参赛队伍提交结果的语音质量与使用模型的参数量进行评分。他表示,当前人工智能技术的快速演进,正重塑音频交互与听觉智能领域的发展格局,并呼吁业界同仁坚持以问题为导向,用扎实的科学实践回应产业升级中的真需求,共同为AI语音技术的突破注入新动能。参与两个赛题的角逐。
2026-09-02 18:03:31
192
原创 语音识别的“幻觉“:听不清的时候,AI 为什么开始编
很多人第一次遇到语音识别的"幻觉",是在一段几乎没有人声的录音里。会议散场后忘了关录音,最后十分钟只有空调声和收拾东西的动静。没有人说过这句话。模型也不是听错了某个字,而是凭空写出了一整句完全通顺、完全不存在的话。这类错误和我们熟悉的"听错"不一样。听错,是听清了但写错了词,而幻觉则是音频里没有对应内容,模型却依然生成了文字。随着越来越多的语音识别系统引入生成式模型,这类问题也值得被单独拿出来讨论。真实系统里的幻觉,大致有三种面孔。无中生有:输入是静音、纯噪声、音乐或者一声咳嗽,输出却是一句完整的话。
2026-09-01 11:34:02
431
原创 ParaASR:多token并行预测加速推理
进行初始化。这样它一开始就拥有较好的语言模型能力。其他分支特有的 projection 参数则随机初始化。
2026-08-24 15:17:42
326
原创 自变量开源|X2Streaming-TTS TTFT仅15.8ms
还有一个细节:完整读对率 73.3%,但听者判断“意思没变”的比例是 93.33%——剩下的错误大多是无伤大雅的读法变体,不是把数念错。读法确定了,还不能把所有文字一直塞进同一个语音段:声学模型的缓存有限,每段的“气”只有这么长——别频繁停下来换气,也别等到气用光了再随便砍一刀。读法确定了,还不能把所有文字一直塞进同一个语音段:声学模型的缓存有限,每段的“气”只有这么长——别频繁停下来换气,也别等到气用光了再随便砍一刀。碰到“2026”这种没有固定读法的数字,先攒着,绝不把半截数字念出去。
2026-08-24 14:55:27
384
原创 多方言ASR自蒸馏:学会方言,不忘普通话
近年来的 ASR 模型已经能够取得很强的普通话识别准确率,同时也具备一定的中文方言识别能力。不过,在真实语音场景中,这些模型对于方言的识别准确率仍然有限。直接针对方言进行适配,可以降低方言的 CER,但是也可能导致普通话 CER 上升。如何对一个本身已经很强的 ASR 模型进行适配,在提高多方言识别能力的同时,不降低它的普通话识别能力。目前已经有多种针对中文方言 ASR 的建模方法。例如 Dolphin-CN-Dialect 针对中文方言 ASR 的模型,重点使用包含丰富方言的数据进行微调训练。
2026-08-21 15:28:18
331
原创 IndexTTS 2.5 让声音跨越语言
本论文主要作者来自哔哩哔哩 Index 语音团队(bilibili Index Speech Team),Index语音团队是一支专注于音频技术创新的研究团队,致力于音频生成、语音合成与音乐技术的前沿探索,重点研究高保真、自然真实、可控性强的语音生成模型。今天和大家聊聊Bilibili最新发布的 IndexTTS 2.5,支持中/英/日/西/阿五国语言零样本配音,推理速度翻倍升级,跨语言情绪还原更自然,同时也支持原声的语速控制能力,补齐上代模型短板。这两条反馈,成了 IndexTTS 2.5 的立项初心。
2026-08-21 14:26:46
348
原创 ECoM-Reasoning:让端到端的语音大模型学会轻量级推理
语音大模型的未来,绝不只是"能听清、能开口",而是能在你说完话的一瞬间,把复杂的问题想明白,然后用最自然的语气告诉你答案。ECoM Reasoning 想做的,正是给这些"会说话的 AI"装上一颗更轻、更快、更聪明的推理大脑,让它在实时对话中不再犹豫,不再啰嗦,不再答非所问。这一步实现,人机对话的边界又会往前推进一点。
2026-08-10 17:30:32
372
原创 GPT-5.6全员免费!下一代巨兽Astra打响闪电战
来源丨新智元不是吧?连GPT-5.6,竟然全员免费了!今早,OpenAI重磅官宣,GPT-5.6 Luna的文本对话,不限量了。全球十亿人,直接免费用。与此同时,GPT-5.6 Sol迎来全新升级——ChatGPT界面新增一根滑块,一统Instant和Thinking两大模式,让Sol在每个问题上想多久自己定。7月9日,OpenAI一口气端出了「GPT-5.6」全家桶,Sol一举击败了最强Fable 5。这还不到一个月的时间,GPT-5.6 Luna直接免费开放了。
2026-08-10 17:02:22
243
原创 9.36M 参数做出顶级 TTS:Inflect v2,人声盲听66%胜率
即使当前 PyTorch 模式下,Micro 版处理 1 秒的音频只需要 160 毫秒的计算时间,足以满足绝大多数实际使用场景的需求。Micro 版的架构细节:隐层通道 192 个,文本编码通道 96 个,编码器 3 层每层 2 头注意力,前馈层通道 768 个,流式耦合模块 4 个,初始解码器通道 320 个,上采样率是 8 倍、8 倍、2 倍、2 倍共四级,训练段长 16384 个采样点。这是一个极致轻量的英文语音合成模型。这些场景不需要克隆别人的声音,不需要多说话人切换,只需要一段自然流畅的语音。
2026-07-30 16:15:30
347
原创 当机器人开始全面认真倾听:音频具身智能综述来了
过去几年,具身 AI、机器人学习、视觉-语言-动作模型发展很快,但音频相关研究仍分散在多个社区: robot audition、audio-visual navigation、spoken instruction following、contact-audio manipulation、social HRI 等等。它们都在使用声音,却往往讨论的是不同问题。如果一个机器人只能看见,它会错过很多关键线索:门外传来的呼救声、杯子落地的瞬间、机械臂接触失败时的摩擦声、用户话语里的犹豫和急迫。
2026-07-30 16:12:05
409
原创 εar-VAE:回归听觉感知的高保真音乐重建
既然重建的终点是听觉,那么从加权曲线的选择、相位监督的对象,到判别器的取舍、数据筛选的标准,都先回答同一个问题——耳朵到底在意什么?模型代码、权重与音频示例已全部开源:https://eps-acoustic-revolution-lab.github.io/EAR_VAE/ ,欢迎直接试听验证,也希望这些工作经验能收获更多社区反馈。
2026-07-28 14:04:52
391
原创 决战8月!Anthropic甩出Fable 5.1,奥特曼携GPT-6连夜汇报决战8月!Anthropic甩出Fable 5.1,奥特曼携GPT-6连夜汇报
来源丨新智元据悉,本周奥特曼已经突降华盛顿,展示了OpenAI有史以来的最强大模型——GPT-6。据外媒Axios爆料,GPT-6 已经具备了进行原创科学研究的能力,并在内部测试中通过不休不眠的智能体集群(Agent Swarms),展现出危险的长程规划与自主渗透能力。而就在同一时刻,Anthropic这边也有消息泄露:Fable 5.1 已经就位,瞄准 8 月,加量不加价,试图以田忌赛马战术,在GPT-6落地前完成狙击这个8月,注定不平静,一场肉搏战即将打响,目标直指ASI的奇点时刻。
2026-07-28 11:57:48
204
原创 大模型的风还是吹到了语音前端
截至2026年6月,语音前端处理算法领域经历了由传统数字信号处理(DSP)与早期判别式深度学习模型向生成式人工智能(Generative AI)、大型语言模模型(LLMs)以及高效状态空间模型(State-Space Models)深度融合的根本性范式转移。语音前端处理不仅涵盖了降噪与单通道语音增强(Speech Enhancement, SE)、声学回声消除(Acoustic Echo Cancellation, AEC)、波束形成与多通道源分离(Beamforming & Source Separati
2026-07-01 10:47:49
393
原创 可控文本到语音的最新进展:从宏观风格到精细表达
从上述工作可以看出,宏观控制路线受益于大语言模型的语义理解和大规模高质量数据集的构建,能够实现以自然语言为接口的灵活风格控制;精细控制路线则通过对齐技术、双自回归、情感-副语言联合建模,在词级、帧级乃至音效级上追求更精准的调节能力。当前挑战依然明确:• 数据:需要更高质量、更高精度标注的数据集(尤其是多语言、多情感、带副语言标签)。• 控制定位:如何同时支持全局风格和局部细节控制,且不相互干扰。• 表现质量:精细控制后仍要保持衔接自然、表达多样,避免机械感。
2026-06-29 14:03:14
325
原创 ISCSLP 2026 | 真实世界视听语音增强挑战赛正式开赛
正如人在喧闹餐厅中会通过观察对方嘴型来辅助理解,让机器同时“看”和“听”,利用说话人的唇动与面部信息增强目标语音,已成为语音处理走向真实落地的重要方向。Real-World AVSE Challenge 希望推动研究者重新思考视听语音增强在真实环境中的关键问题:当音频不再是人工合成的理想混合语音,当视频不再总是清晰稳定,当目标说话人处于多人、远场和视觉退化环境中,AVSE 模型是否仍然能够稳定工作?与传统基于人工合成混合语音的数据不同,该赛道提供自然录制的多人视听数据,其中语音重叠和环境干扰为真实场景。
2026-06-25 11:09:49
364
原创 ICML 2026 | 合成数据也能训出 SOTA 低资源 TTS
如果一个语言缺少大规模高质量录音,但可以获得基础文本、少量真实语音和可用 ASR,那么类似流程就有迁移空间:使用开源 TTS/SLM 底座作为初始化,用合成数据补足发音覆盖,监控合成比例带来的稳定性和表现力变化,在有真实参考时使用 DGSA 做偏好对齐,在真实语音不足时使用 TDSC 做多温度自批判和迭代筛选。SE-Bridge-TTS 没有从头训练一个更大的多语言基础模型,而是基于已有开源底座 CosyVoice2,从数据层面重新拆解低资源 TTS 的训练问题:真实语音稀缺时,合成数据如何使用?
2026-06-25 10:38:09
362
原创 【预讲会征集】ACL 2026 论文预讲会
ACL(Annual Meeting of the Association for Computational Linguistics)是计算语言学与自然语言处理领域国际公认的顶级学术会议,同时也是中国计算机学会(CCF)推荐的A类国际学术会议。为了共创高质量的论文预讲会,我们诚挚邀请所有 ACL 2026 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。ACL 2026 论文预讲会已正式开启,并持续到6月。面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。
2026-05-15 17:48:37
93
原创 Dolphin-CN-Dialect 发布:同样的数据,换一种配方,让ASR听懂更多中国话
作为仅0.4B参数量的轻量模型,它在同梯队(≤0.8B)中拿下双测试集最优表现,性能全面超越 Qwen3-0.6B、FunASR-Nano-2512等更大参数量模型,甚至优于1.7B的Qwen3-1.7B,展现出极高的参数效率。宁夏、湖北、陕西、河南、山西、天津、山东等方言测试集均有明显提升。团队希望Dolphin-CN-Dialect的发布,能够补齐汉语方言语音识别的短板,让语音识别不只听懂标准普通话,更能听懂更真实的中国话,推动多方言语音技术在日常沟通、办公协作、行业服务等场景的普及与落地。
2026-05-15 17:45:15
442
原创 【征稿启事】第十五届中文口语语言处理国际研讨会 (ISCSLP 2026) 邀您相聚马来西亚槟城!
第十五届中文口语语言处理国际研讨会(ISCSLP2026)将于2026年11月14-17日在马来西亚槟城举行。作为ISCA下属旗舰会议,该会议涵盖语音识别、合成、理解等前沿方向,接受4-8页论文投稿(截止2026.6.12),采用双盲评审。会议还将举办特别专题、挑战赛和教程(提案截止2026.6.8)。槟城以其多元文化和科技氛围为参会者提供学术交流与文化体验的双重机会。详情请访问会议官网。
2026-04-21 10:44:18
463
原创 语音降噪风雨六十载(上)——传统信号处理黄金时代
在传统语音降噪方法中,都基于以下四个假设假设一、语音和噪声是统计独立的;假设二、噪声相比于语音更加平稳;假设三、时频点是统计独立的;假设四、人耳对语音相位不敏感;第一个假设是合理的,然而其他三个假设在某些条件下并不真正成立。假设二是传统语音降噪中噪声估计模块的基础,然而实际场景中非稳态噪声也是普遍存在的。对于假设三来说,语音和噪声频点之间必然存在相关性,这就导致基于统计模型的方法比不可能完全成立,这也限制了传统降噪算法的性能。
2026-03-05 11:49:45
555
原创 第四期 | ICASSP 2026 论文预讲会(南洋理工大学 DSP Lab)
在采用在线次级路径建模的 FxLMS 框架下的实验结果表明,与不进行再初始化的基线方案相比,所提方法能够在系统启动与路径切换后显著降低初期残余噪声、缩短达到稳定性能的时间,同时减少引入的辅助噪声能量,并提升路径变化后的系统降噪性能恢复速度。仿真结果表明,所提出的异步通信分布式多通道主动噪声控制(ACDMCANC)系统在显著降低通信负载的情况下,仍能保持有效的噪声抑制性能,从而为异构网络环境下的系统扩展性提供了更优的解决方案。主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。
2026-02-28 11:33:11
623
原创 从 “能说话” 到 “会说话”:Meta+MIT 联手打出 GSRM “声学 + 推理” 组合拳,合成语音自然度赢率飙升 82%
GSRM 的核心创新,在于把语音评估从 “黑盒打分” 变成了 “白盒推理”—— 它不再是简单的数值输出,而是能像人类评委一样,精准指出 “元音音调变化过大导致语调不自然”“节奏不均匀影响类人性” 等具体问题,为模型优化提供明确方向。更重要的是,它打通了 “评估→优化” 的闭环,让语音大模型能自主迭代提升自然度,实测 82% 的人类偏好赢率证明了其有效性。对于语音技术开发者来说,GSRM 不仅是一个评估工具,更是一套可直接落地的语音 RLHF 解决方案;
2026-02-27 18:21:11
546
原创 融声向善语音资源开源计划丨AISHELL-6 系列特殊声学特征语音语料库全面开放,助力人机交互向善发展
未来,希尔贝壳将秉持长期开源、优质开源的原则,持续迭代并开源更多覆盖多元场景、适配特殊需求的高质量语音数据集,为全球语音技术领域的模型创新、算法优化及应用落地提供坚实的数据支撑,助力破解非典型语音研究中的技术瓶颈,推动语音智能技术向更精准、更普惠、更多元的方向发展。希尔贝壳联合昆山杜克大学开源项目,语料库在安静的录音棚环境中采集,包含约29.8小时的耳语语音与平行录制的29.5小时正常语音,和同步采集的唇动视频。通过Zoom或腾讯会议等平台进行的在线访谈,旨在能够捕捉在多样化主题下录音人的自然口语。
2026-02-26 17:40:01
998
原创 清华和盛大东京团队提出Hive数据集:以数据质量取代规模,实现高效通用声音分离
生成式模型(如SAM-Audio)在感知指标上表现较好(FAD≈1.0),但在语义保真度上落后(CLAP-T),表明存在条件合成而非真正提取的倾向。Hive数据量仅为SAM-Audio的约0.2%(2.4k vs. 1M小时),在USS-Bench上AudioSep(Hive)的FAD达0.75(SAM-Audio为0.90),CLAP-Audio达0.69(SAM-Audio为0.57)。Hive数据流水线的标注纯度,团队设计了一项四选一强制选择(4-AFC)音频事件识别实验。
2026-02-26 10:36:33
712
原创 第一期 | ICASSP 2026 论文预讲会(昆山杜克大学语音及多模态智能信息处理实验室)
武汉大学计算机科学与技术专业三年级硕士生,昆山杜克大学语音及多模态智能信息处理实验室研究实习生, 研究方向为声纹识别、说话人日志。
2026-02-03 15:07:55
1105
原创 VoiceSculptor——音色设计、风格可控的语音生成模型,技术报告来啦!
在AI语音合成领域,能精准听懂自然语言指令、实现细粒度控制的开源工具一直是行业痛点。近期,西工大音频语音与语言处理研究组(ASLP@NPU)与语图智能技术公司(Yutu Zhineng)、上海灵光乍现技术团队(Shanghai Lingguang Zhaxian Technology)、Wenet社区(WeNet Open Source Community)正式。该模型是一款专为音色设计、风格可控打造的语音生成模型,支持语速、音量、基频等属性可控,可以通过自然语言指令生成成千上万种不同音色的音频。
2026-02-02 18:19:52
844
原创 FlashLabs开源Chroma 1.0:实时、高保真语音克隆与对话的端到端模型
标题:FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning链接:https://arxiv.org/pdf/2601.11141作者单位:FlashLabs发表日期:2026年1月16日开源地址:https://github.com/FlashLabs-AI-Corp/FlashLabs-Chroma‘
2026-02-02 17:36:19
1167
原创 Sora 2瑟瑟发抖!通义万相2.5放大招:一句话出1080P电影,音画精准同步
Veo 3真正对手,竟不是Sora 2!通义万相2.5全网首发,直接甩出王炸:一句话,直出10秒1080P电影级视频,首次实现音画精准同步。一键生成BGM、人声,全网实测玩疯。四个月前,谷歌DeepMind重磅推出Veo 3,首次实现「音画同步」,让AI视频彻底告别无声时代!一段提示,可以直吐4K高清视频,还自带逼真音效,唇同步准到毫秒级别。在云栖大会上,通义万相2.5(Wan2.5-preview)系列模型正式亮相,全模态生成一网打尽。它包含了四大模型——文生视频、图生视频、文生图、图像编辑。
2025-12-17 13:48:19
750
原创 2025年CCF先进音频技术竞赛
本赛题旨在鼓励参赛者探索和实现面向真实世界复杂链路的下一代语音修复算法,以显著提升语音信号的质量、可懂度和听感自然度。本任务要求参赛队伍针对给定的、经历了多重损伤的语音,设计并实现一个统一的修复模型,输出最大程度接近原始质量的纯净语音。
2025-06-23 16:14:37
850
原创 非线性声学计算与强化学习融合框架:突破复杂环境人机交互的新技术
该技术借助非线性声学理论,有效捕捉高阶声学现象,结合强化学习实现实时参数优化,显著提升了系统在噪声抑制、语音识别、语音克隆等关键任务上的性能。尽管传统声学方法取得了显著成功,但这些线性或准线性方法在实际环境中往往存在关键的不足,尤其在动态、复杂或混响环境中,远场语音处理、弱声信号检测和复杂的噪声抑制仍然是亟待解决的问题。是该系统的理论基础。在强噪声环境下,可准确区分多种声音情感及400+声学环境事件(如开门声、脚步声、警报声等),在不同应用场景中能深入理解用户意图,提供高质量的交互服务。
2025-05-29 17:28:42
962
原创 ICASSP2025丨融合语音停顿信息与语言模型的阿尔兹海默病检测
然后,将这两个嵌入在特征维度上拼接起来,并将其添加到词嵌入中,从而在 BERT 模型的编码阶段将停顿信息与文本信息融合在一起。使用WhisperX语音识别模型转录自发语音后,我们提取转录文本中每个单词的持续时间和停顿时间,将它们结合为一个停顿标记,并在一定区间内进行均匀量化,得到一个停顿标记的码本,之后对其进行可学习的嵌入映射。在本文中,我们提出了一种方法,在语言模型的编码阶段将停顿与文本内容相结合,以捕捉语音中的语义和副语言特征,从而提高 AD 检测的性能。,可以有效提升基于自发语音的AD检测效果。
2025-05-29 17:21:57
982
原创 A Comprehensive Survey of Spoken Language Models
为填补该领域系统性综述的空白,芝加哥大学、卡内基梅隆大学、台湾大学与Meta等单位的研究者联合撰写了首份全面综述论文——《On The Landscape of Spoken Language Models: A Comprehensive Survey》。该论文聚焦SLM的发展现状,系统梳理了当前语音大语言模型的定义、模型架构、训练方式与评估策略。这篇综述也讨论了SLM取得的重要进展与当前面临的挑战,展望SLM作为未来通用语音处理系统的潜力与前景。
2025-04-25 11:34:53
610
原创 最新开源模型DeepCoder,媲美OpenAI-o3,训练方法、数据集大公开
今日,AI界突现开源重磅——Together AI与Agentica全面开源DeepCoder-14B-Preview,不仅开放模型权重,更罕见公开了完整训练数据、方法及优化细节。值得一提的是,Together AI不仅开源了DeepCoder-14B的模型权重,还完整公开了训练数据集、方法、日志及优化方案,使开发者能够全面掌握该模型的开发全流程。通过消除熵损失和KL损失、引入过长过滤和上限裁剪等技术,GRPO+使模型在训练过程中能够保持稳定的熵值,避免训练崩溃,并能更自然地生成较长输出,提高了推理能力。
2025-04-10 15:32:53
1215
空空如也
WeNet进行一些简单的优化rtf大概能到多少?
2022-08-01
-context_score 这个值是什么范围?一般多少合适?
2022-07-22
web socket server支持语言模型吗?
2022-07-22
在流式识别中,如何解决背景噪音带来的干扰?
2022-07-22
热词的文件是什么结构?
2022-07-20
web socket server 怎么启用热词?
2022-07-20
如果想充分理解一个预训练模型的算法,比如aishell预训练模型,应该从哪入手?
2022-07-19
端到端模型对于领域文本优化有什么方案可以在实际应用中使用的?
2022-07-19
WeNet有什么独特的地方吗?比如流识别方面?
2022-07-19
WeNet 转 onnx 的时候要拆成几个模型导出,可以合并为一个吗?
2022-07-19
热词增强和热词唤醒在实现上的区别是什么?
2022-07-05
请问现在工业上用传统的技术多还是端到端的技术多啊?
2022-07-05
aishell example运行stage 4,遇到这个报错,请问是什么问题?
2022-08-03
模型测试时,使用的average model,这是什么方法,有没有参考资料。
2022-08-03
用了aishell的数据集报这种问题的原因是什么?
2022-08-03
想着用自己电脑训模型,理论上可以吗?
2022-08-03
sort是让一个batch内的音频按顺序排列吗?
2022-08-02
最后一个模型量化,在x86上也是有必要的吗?速度会提升多少?
2022-08-02
单并发,用的WeNetspeech离线大模型以及libtorch1.10,rescore和search都在500ms+,,为什么这么慢呢?一般TLG有多大呀?语言模型大小会很影响速度的吧?
2022-08-02
热词标记,但是最后没有实现是因为什么?
2022-08-01
热词输出带上 context 的标志了,是不是通过参数可以控制?还是要改下代码,去掉?
2022-08-01
一般这种websocket 如何做高并发,有没有好的解决方案呢
2022-08-01
请问cmake -B build的时候报这个错,大家有遇到的吗?
2022-08-03
这个热词文件,有行数限制么?比如:3万行,可以么?
2022-08-01
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅