- 博客(374)
- 问答 (44)
- 收藏
- 关注
原创 WeNet语音识别实战
音之家-AI工匠学堂推出《WeNet语音识别实战》, WeNet是目前工业界最流行的开源端到端语音识别系统之一,也是学习端到端语音识别的最佳实践项目。语音识别的学习者和从业者,可以通过学习这门课程高效全面的掌握WeNet的基本原理和实战方法,降低自己摸索的成本,快速构建出高性能的语音识别系统。...
2022-06-21 15:06:58
7622
4
原创 9.36M 参数做出顶级 TTS:Inflect v2,人声盲听66%胜率
即使当前 PyTorch 模式下,Micro 版处理 1 秒的音频只需要 160 毫秒的计算时间,足以满足绝大多数实际使用场景的需求。Micro 版的架构细节:隐层通道 192 个,文本编码通道 96 个,编码器 3 层每层 2 头注意力,前馈层通道 768 个,流式耦合模块 4 个,初始解码器通道 320 个,上采样率是 8 倍、8 倍、2 倍、2 倍共四级,训练段长 16384 个采样点。这是一个极致轻量的英文语音合成模型。这些场景不需要克隆别人的声音,不需要多说话人切换,只需要一段自然流畅的语音。
2026-07-30 16:15:30
328
原创 当机器人开始全面认真倾听:音频具身智能综述来了
过去几年,具身 AI、机器人学习、视觉-语言-动作模型发展很快,但音频相关研究仍分散在多个社区: robot audition、audio-visual navigation、spoken instruction following、contact-audio manipulation、social HRI 等等。它们都在使用声音,却往往讨论的是不同问题。如果一个机器人只能看见,它会错过很多关键线索:门外传来的呼救声、杯子落地的瞬间、机械臂接触失败时的摩擦声、用户话语里的犹豫和急迫。
2026-07-30 16:12:05
359
原创 εar-VAE:回归听觉感知的高保真音乐重建
既然重建的终点是听觉,那么从加权曲线的选择、相位监督的对象,到判别器的取舍、数据筛选的标准,都先回答同一个问题——耳朵到底在意什么?模型代码、权重与音频示例已全部开源:https://eps-acoustic-revolution-lab.github.io/EAR_VAE/ ,欢迎直接试听验证,也希望这些工作经验能收获更多社区反馈。
2026-07-28 14:04:52
376
原创 决战8月!Anthropic甩出Fable 5.1,奥特曼携GPT-6连夜汇报决战8月!Anthropic甩出Fable 5.1,奥特曼携GPT-6连夜汇报
来源丨新智元据悉,本周奥特曼已经突降华盛顿,展示了OpenAI有史以来的最强大模型——GPT-6。据外媒Axios爆料,GPT-6 已经具备了进行原创科学研究的能力,并在内部测试中通过不休不眠的智能体集群(Agent Swarms),展现出危险的长程规划与自主渗透能力。而就在同一时刻,Anthropic这边也有消息泄露:Fable 5.1 已经就位,瞄准 8 月,加量不加价,试图以田忌赛马战术,在GPT-6落地前完成狙击这个8月,注定不平静,一场肉搏战即将打响,目标直指ASI的奇点时刻。
2026-07-28 11:57:48
200
原创 大模型的风还是吹到了语音前端
截至2026年6月,语音前端处理算法领域经历了由传统数字信号处理(DSP)与早期判别式深度学习模型向生成式人工智能(Generative AI)、大型语言模模型(LLMs)以及高效状态空间模型(State-Space Models)深度融合的根本性范式转移。语音前端处理不仅涵盖了降噪与单通道语音增强(Speech Enhancement, SE)、声学回声消除(Acoustic Echo Cancellation, AEC)、波束形成与多通道源分离(Beamforming & Source Separati
2026-07-01 10:47:49
351
原创 可控文本到语音的最新进展:从宏观风格到精细表达
从上述工作可以看出,宏观控制路线受益于大语言模型的语义理解和大规模高质量数据集的构建,能够实现以自然语言为接口的灵活风格控制;精细控制路线则通过对齐技术、双自回归、情感-副语言联合建模,在词级、帧级乃至音效级上追求更精准的调节能力。当前挑战依然明确:• 数据:需要更高质量、更高精度标注的数据集(尤其是多语言、多情感、带副语言标签)。• 控制定位:如何同时支持全局风格和局部细节控制,且不相互干扰。• 表现质量:精细控制后仍要保持衔接自然、表达多样,避免机械感。
2026-06-29 14:03:14
316
原创 ISCSLP 2026 | 真实世界视听语音增强挑战赛正式开赛
正如人在喧闹餐厅中会通过观察对方嘴型来辅助理解,让机器同时“看”和“听”,利用说话人的唇动与面部信息增强目标语音,已成为语音处理走向真实落地的重要方向。Real-World AVSE Challenge 希望推动研究者重新思考视听语音增强在真实环境中的关键问题:当音频不再是人工合成的理想混合语音,当视频不再总是清晰稳定,当目标说话人处于多人、远场和视觉退化环境中,AVSE 模型是否仍然能够稳定工作?与传统基于人工合成混合语音的数据不同,该赛道提供自然录制的多人视听数据,其中语音重叠和环境干扰为真实场景。
2026-06-25 11:09:49
328
原创 ICML 2026 | 合成数据也能训出 SOTA 低资源 TTS
如果一个语言缺少大规模高质量录音,但可以获得基础文本、少量真实语音和可用 ASR,那么类似流程就有迁移空间:使用开源 TTS/SLM 底座作为初始化,用合成数据补足发音覆盖,监控合成比例带来的稳定性和表现力变化,在有真实参考时使用 DGSA 做偏好对齐,在真实语音不足时使用 TDSC 做多温度自批判和迭代筛选。SE-Bridge-TTS 没有从头训练一个更大的多语言基础模型,而是基于已有开源底座 CosyVoice2,从数据层面重新拆解低资源 TTS 的训练问题:真实语音稀缺时,合成数据如何使用?
2026-06-25 10:38:09
352
原创 【预讲会征集】ACL 2026 论文预讲会
ACL(Annual Meeting of the Association for Computational Linguistics)是计算语言学与自然语言处理领域国际公认的顶级学术会议,同时也是中国计算机学会(CCF)推荐的A类国际学术会议。为了共创高质量的论文预讲会,我们诚挚邀请所有 ACL 2026 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。ACL 2026 论文预讲会已正式开启,并持续到6月。面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。
2026-05-15 17:48:37
84
原创 Dolphin-CN-Dialect 发布:同样的数据,换一种配方,让ASR听懂更多中国话
作为仅0.4B参数量的轻量模型,它在同梯队(≤0.8B)中拿下双测试集最优表现,性能全面超越 Qwen3-0.6B、FunASR-Nano-2512等更大参数量模型,甚至优于1.7B的Qwen3-1.7B,展现出极高的参数效率。宁夏、湖北、陕西、河南、山西、天津、山东等方言测试集均有明显提升。团队希望Dolphin-CN-Dialect的发布,能够补齐汉语方言语音识别的短板,让语音识别不只听懂标准普通话,更能听懂更真实的中国话,推动多方言语音技术在日常沟通、办公协作、行业服务等场景的普及与落地。
2026-05-15 17:45:15
377
原创 【征稿启事】第十五届中文口语语言处理国际研讨会 (ISCSLP 2026) 邀您相聚马来西亚槟城!
第十五届中文口语语言处理国际研讨会(ISCSLP2026)将于2026年11月14-17日在马来西亚槟城举行。作为ISCA下属旗舰会议,该会议涵盖语音识别、合成、理解等前沿方向,接受4-8页论文投稿(截止2026.6.12),采用双盲评审。会议还将举办特别专题、挑战赛和教程(提案截止2026.6.8)。槟城以其多元文化和科技氛围为参会者提供学术交流与文化体验的双重机会。详情请访问会议官网。
2026-04-21 10:44:18
397
原创 语音降噪风雨六十载(上)——传统信号处理黄金时代
在传统语音降噪方法中,都基于以下四个假设假设一、语音和噪声是统计独立的;假设二、噪声相比于语音更加平稳;假设三、时频点是统计独立的;假设四、人耳对语音相位不敏感;第一个假设是合理的,然而其他三个假设在某些条件下并不真正成立。假设二是传统语音降噪中噪声估计模块的基础,然而实际场景中非稳态噪声也是普遍存在的。对于假设三来说,语音和噪声频点之间必然存在相关性,这就导致基于统计模型的方法比不可能完全成立,这也限制了传统降噪算法的性能。
2026-03-05 11:49:45
520
原创 第四期 | ICASSP 2026 论文预讲会(南洋理工大学 DSP Lab)
在采用在线次级路径建模的 FxLMS 框架下的实验结果表明,与不进行再初始化的基线方案相比,所提方法能够在系统启动与路径切换后显著降低初期残余噪声、缩短达到稳定性能的时间,同时减少引入的辅助噪声能量,并提升路径变化后的系统降噪性能恢复速度。仿真结果表明,所提出的异步通信分布式多通道主动噪声控制(ACDMCANC)系统在显著降低通信负载的情况下,仍能保持有效的噪声抑制性能,从而为异构网络环境下的系统扩展性提供了更优的解决方案。主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。
2026-02-28 11:33:11
604
原创 从 “能说话” 到 “会说话”:Meta+MIT 联手打出 GSRM “声学 + 推理” 组合拳,合成语音自然度赢率飙升 82%
GSRM 的核心创新,在于把语音评估从 “黑盒打分” 变成了 “白盒推理”—— 它不再是简单的数值输出,而是能像人类评委一样,精准指出 “元音音调变化过大导致语调不自然”“节奏不均匀影响类人性” 等具体问题,为模型优化提供明确方向。更重要的是,它打通了 “评估→优化” 的闭环,让语音大模型能自主迭代提升自然度,实测 82% 的人类偏好赢率证明了其有效性。对于语音技术开发者来说,GSRM 不仅是一个评估工具,更是一套可直接落地的语音 RLHF 解决方案;
2026-02-27 18:21:11
524
原创 融声向善语音资源开源计划丨AISHELL-6 系列特殊声学特征语音语料库全面开放,助力人机交互向善发展
未来,希尔贝壳将秉持长期开源、优质开源的原则,持续迭代并开源更多覆盖多元场景、适配特殊需求的高质量语音数据集,为全球语音技术领域的模型创新、算法优化及应用落地提供坚实的数据支撑,助力破解非典型语音研究中的技术瓶颈,推动语音智能技术向更精准、更普惠、更多元的方向发展。希尔贝壳联合昆山杜克大学开源项目,语料库在安静的录音棚环境中采集,包含约29.8小时的耳语语音与平行录制的29.5小时正常语音,和同步采集的唇动视频。通过Zoom或腾讯会议等平台进行的在线访谈,旨在能够捕捉在多样化主题下录音人的自然口语。
2026-02-26 17:40:01
940
原创 清华和盛大东京团队提出Hive数据集:以数据质量取代规模,实现高效通用声音分离
生成式模型(如SAM-Audio)在感知指标上表现较好(FAD≈1.0),但在语义保真度上落后(CLAP-T),表明存在条件合成而非真正提取的倾向。Hive数据量仅为SAM-Audio的约0.2%(2.4k vs. 1M小时),在USS-Bench上AudioSep(Hive)的FAD达0.75(SAM-Audio为0.90),CLAP-Audio达0.69(SAM-Audio为0.57)。Hive数据流水线的标注纯度,团队设计了一项四选一强制选择(4-AFC)音频事件识别实验。
2026-02-26 10:36:33
703
原创 第一期 | ICASSP 2026 论文预讲会(昆山杜克大学语音及多模态智能信息处理实验室)
武汉大学计算机科学与技术专业三年级硕士生,昆山杜克大学语音及多模态智能信息处理实验室研究实习生, 研究方向为声纹识别、说话人日志。
2026-02-03 15:07:55
1096
原创 VoiceSculptor——音色设计、风格可控的语音生成模型,技术报告来啦!
在AI语音合成领域,能精准听懂自然语言指令、实现细粒度控制的开源工具一直是行业痛点。近期,西工大音频语音与语言处理研究组(ASLP@NPU)与语图智能技术公司(Yutu Zhineng)、上海灵光乍现技术团队(Shanghai Lingguang Zhaxian Technology)、Wenet社区(WeNet Open Source Community)正式。该模型是一款专为音色设计、风格可控打造的语音生成模型,支持语速、音量、基频等属性可控,可以通过自然语言指令生成成千上万种不同音色的音频。
2026-02-02 18:19:52
812
原创 FlashLabs开源Chroma 1.0:实时、高保真语音克隆与对话的端到端模型
标题:FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning链接:https://arxiv.org/pdf/2601.11141作者单位:FlashLabs发表日期:2026年1月16日开源地址:https://github.com/FlashLabs-AI-Corp/FlashLabs-Chroma‘
2026-02-02 17:36:19
1147
原创 Sora 2瑟瑟发抖!通义万相2.5放大招:一句话出1080P电影,音画精准同步
Veo 3真正对手,竟不是Sora 2!通义万相2.5全网首发,直接甩出王炸:一句话,直出10秒1080P电影级视频,首次实现音画精准同步。一键生成BGM、人声,全网实测玩疯。四个月前,谷歌DeepMind重磅推出Veo 3,首次实现「音画同步」,让AI视频彻底告别无声时代!一段提示,可以直吐4K高清视频,还自带逼真音效,唇同步准到毫秒级别。在云栖大会上,通义万相2.5(Wan2.5-preview)系列模型正式亮相,全模态生成一网打尽。它包含了四大模型——文生视频、图生视频、文生图、图像编辑。
2025-12-17 13:48:19
735
原创 2025年CCF先进音频技术竞赛
本赛题旨在鼓励参赛者探索和实现面向真实世界复杂链路的下一代语音修复算法,以显著提升语音信号的质量、可懂度和听感自然度。本任务要求参赛队伍针对给定的、经历了多重损伤的语音,设计并实现一个统一的修复模型,输出最大程度接近原始质量的纯净语音。
2025-06-23 16:14:37
843
原创 非线性声学计算与强化学习融合框架:突破复杂环境人机交互的新技术
该技术借助非线性声学理论,有效捕捉高阶声学现象,结合强化学习实现实时参数优化,显著提升了系统在噪声抑制、语音识别、语音克隆等关键任务上的性能。尽管传统声学方法取得了显著成功,但这些线性或准线性方法在实际环境中往往存在关键的不足,尤其在动态、复杂或混响环境中,远场语音处理、弱声信号检测和复杂的噪声抑制仍然是亟待解决的问题。是该系统的理论基础。在强噪声环境下,可准确区分多种声音情感及400+声学环境事件(如开门声、脚步声、警报声等),在不同应用场景中能深入理解用户意图,提供高质量的交互服务。
2025-05-29 17:28:42
958
原创 ICASSP2025丨融合语音停顿信息与语言模型的阿尔兹海默病检测
然后,将这两个嵌入在特征维度上拼接起来,并将其添加到词嵌入中,从而在 BERT 模型的编码阶段将停顿信息与文本信息融合在一起。使用WhisperX语音识别模型转录自发语音后,我们提取转录文本中每个单词的持续时间和停顿时间,将它们结合为一个停顿标记,并在一定区间内进行均匀量化,得到一个停顿标记的码本,之后对其进行可学习的嵌入映射。在本文中,我们提出了一种方法,在语言模型的编码阶段将停顿与文本内容相结合,以捕捉语音中的语义和副语言特征,从而提高 AD 检测的性能。,可以有效提升基于自发语音的AD检测效果。
2025-05-29 17:21:57
975
原创 A Comprehensive Survey of Spoken Language Models
为填补该领域系统性综述的空白,芝加哥大学、卡内基梅隆大学、台湾大学与Meta等单位的研究者联合撰写了首份全面综述论文——《On The Landscape of Spoken Language Models: A Comprehensive Survey》。该论文聚焦SLM的发展现状,系统梳理了当前语音大语言模型的定义、模型架构、训练方式与评估策略。这篇综述也讨论了SLM取得的重要进展与当前面临的挑战,展望SLM作为未来通用语音处理系统的潜力与前景。
2025-04-25 11:34:53
607
原创 最新开源模型DeepCoder,媲美OpenAI-o3,训练方法、数据集大公开
今日,AI界突现开源重磅——Together AI与Agentica全面开源DeepCoder-14B-Preview,不仅开放模型权重,更罕见公开了完整训练数据、方法及优化细节。值得一提的是,Together AI不仅开源了DeepCoder-14B的模型权重,还完整公开了训练数据集、方法、日志及优化方案,使开发者能够全面掌握该模型的开发全流程。通过消除熵损失和KL损失、引入过长过滤和上限裁剪等技术,GRPO+使模型在训练过程中能够保持稳定的熵值,避免训练崩溃,并能更自然地生成较长输出,提高了推理能力。
2025-04-10 15:32:53
1204
原创 老黄携GB300震撼登场!DeepSeek推理暴涨40倍加速全球最快,26年Rubin问世
这次,老黄的金句直接升级为「买得越多,赚得越多」。老黄展示这张图中,x轴代表了生成的token,y轴代表着每秒token吞吐效率,理想情况下,图中黄色曲线应该是一个方形,即在工厂能力极限之内,非常快速生成token。但老黄认为,技术进步太快,工作负载又重,像AI工厂这样的大型项目,最好投资在最新版本的技术上,比如Blackwell,这样才能跟上潮流,避免落后。相比之下,新的Blackwell架构比Hopper强多了,尤其在能耗固定的情况下,性能提升了25倍,甚至在推理模型上直接比Hopper高40倍。
2025-03-28 11:52:22
1592
原创 新算法实现混响环境中多说话人语音分离
通过调整A组麦克风数量(5/7/10个)发现,当A组为7个、B组固定17个时,以第一个说话人为例,其短时客观可懂度(STOI)从处理前的37.35%提升至92.16%,信干比(SIR)从1.40dB跃升至25.37dB,信畸比(SDR)达到9.49dB。在实际办公室环境(2.94×4.4×3.04米,混响时间410ms)的验证中,使用15个麦克风(A组5个,B组10个)对2个说话人与2个噪声源进行分离。个噪声源,Q个麦克风被划分为两组(A组和B组),其接收信号可表示为传递函数矩阵与声源信号的线性组合。
2025-03-28 11:32:20
1515
原创 开源超越GPT-4o!中国团队造出“SQL翻译官”,250万数据炼成真功夫
未来,有望扩展至多语言、多数据库引擎场景,在自然语言交互式数据分析中发挥更大作用,推动大数据和人工智能技术发展应用。从自然语言问题到SQL查询的推理步骤,让用户明白模型如何得出结果,提高模型可解释性与用户信任度,也方便研究人员优化模型。训练时,模型学习问题到SQL的转换,也学习每步推理逻辑,提高推理准确性与可靠性,向用户展示透明推理过程,增强信任。在Spider、BIRD等9个权威文本转SQL基准测试中,OmniSQL成绩优异,,不依赖外部SQL修正模块,减少系统复杂性与维护成本,提升运行效率与稳定性。
2025-03-18 15:13:44
1478
原创 LIFT:将长上下文知识注入模型参数,提升大模型长文本能力
为了在模型原有能力和微调后新的参数内知识之间找到平衡,我们提出了一种专门的参数高效微调模块——门控记忆适配器(Gated Memory Adapter),它能平衡原始模型的 In-Context Learning(ICL)能力和 LIFT 训练后对长输入的记忆理解能力。针对每一篇需要处理的长文本,LIFT 通过分段的 language modeling 以及精心设计的辅助任务来微调模型,实现用模型参数来记忆和理解长文本,从而避免过长的 context 造成的推理复杂度提升和长程依赖丢失。
2025-03-18 15:06:51
849
原创 DeepSeek一口气开源3个项目,训练速度,GPU利用,优化经验
DeepSeek 的开源周已经进行到了第四天。今天这家公司一口气发布了两个工具和一个数据集:DualPipe、EPLB 以及来自训练和推理框架的分析数据。来源丨新智元、机器之心、赛博禅心DeepSe此次本次开源的三个项目:DualPipe:一种用于V3/R1模型训练中实现计算与通信重叠的双向流水线并行算法;EPLB:一个针对V3/R1的专家并行负载均衡工具;深入分析V3/R1模型中的计算与通信重叠机制。
2025-02-28 11:13:19
900
原创 【直播预告】Xmart•学生论坛丨袁锐斌:Scaling Foundation Models for Music
音乐是跨越人类文明的通用语言,与创造力、文化和情感深度融合。本次演讲将分享我们在构建开源音乐基础模型过程中的探索历程。我们秉持"AGI不仅应理解与创作音乐,也应从音乐学习中受益"的愿景,系统性地推进音乐智能研究。首先介绍业界广泛应用的MERT——基于音频模态的音乐理解模型。随后展示如何将符号音乐理解与生成能力融入LLaMA框架,实现自然语言与符号表征的统一建模(ChatMusician)。
2025-02-28 11:11:03
821
原创 OpenAI开源SWELancer,大模型冲击100万年薪
具体来讲,SWE-Lancer 包括了独立工程任务(从 50 美元的 bug 修复到 32,000 美元的功能实现)和管理任务,其中模型选择各种技术实施方案。目前,测试模型代码能力的基准主要有SWE-Bench和SWE-BenchVerified,但这两个有一个很大的局限性,主要针对孤立任务,很难反映现实中软件工程师的复杂情况。对于 OpenAI 开源的这个基准测试,有人认为很棒,并表示随着软件工程中 AI 能力的扩展,拥有标准化的评估方法非常重要,但应该是独立的。任务是全栈式的,而且很复杂。
2025-02-21 11:16:55
1691
原创 人工智能语音合成公司ElevenLabs获1.8亿美元C轮融资,估值33亿美元
此轮融资由Andreessen Horowitz和ICONIQ Growth联合领投,其他投资者包括NEA、World Innovation Lab、Valor、Endeavor Catalyst Fund、Lunate、Sequoia Capital、Salesforce Ventures、Smash Capital、SV Angel、NFDG和BroadLight Capital。近日,据海外媒体报道,人工智能语音合成公司ElevenLabs宣布已完成1.8亿美元的C轮融资,其估值也达到了33亿美元。
2025-02-13 13:49:19
974
原创 小红书最新开源语音识别模型FireRedASR,中文效果新SOTA
值得一提的是,在需要歌词识别能力的场景中,FireRedASR-LLM 也表现出极强的适配能力,CER 实现了 50.2%~66.7% 的相对降低,这一成果进一步拓宽了 FireRedASR 的应用范围,使其不仅能胜任传统语音识别需求,还能在创新性的多媒体场景中大放异彩。FireRedASR-AED(右下):基于经典的 Attention-based Encoder-Decoder 架构,FireRedASR-AED 通过扩展参数至 1.1B,成功平衡了 ASR 语音识别的高准确率与推理效率。
2025-02-13 13:30:59
2621
原创 AI教父辛顿力挺马斯克,明确反对 OpenAI 的营利化转型。
让我们回到2015年,当时的OpenAI是以非营利研究机构的身份诞生的。2024年2月,马斯克发起诉讼,要求北加州联邦法院阻止OpenAI改变其结构,他认为非营利组织不能违背其最初的使命,这些使命得到了包括他在内的捐赠者的支持。Encode认为,OpenAI目前所采用的非营利控制结构提供了必要的治理护栏,如果将控制权移交给营利性实体,这些护栏将被剥夺。作为AI领域的传奇人物,杰弗里·辛顿教授不仅是2024年诺贝尔物理学奖得主,更被誉为"人工智能教父",他深知技术快速发展的背后,风险同样在加速。
2025-01-09 16:04:29
430
原创 ICASSP2025丨上交大跨媒体语言智能实验室12篇录用论文分享
自动音频描述(AAC)的目标是为输入的音频信号生成自然的文本描述。近年来,音频预训练模型和大语言模型(LLMs)的发展显著提升了音频理解和文本推理能力,为AAC的改进带来了可能性。在本文中,我们提出了SLAM-AAC,通过引入重述增强和CLAP-Refine策略进一步提升AAC性能。我们使用音频自监督模型EAT提取细粒度音频表征,并通过轻量级的线性层将其与文本嵌入对齐。生成音频描述的LLM通过LoRA适配器实现高效微调。借鉴机器翻译中的回译方法,我们在预训练阶段实施了重述增强策略,以扩展Clotho数据集。
2025-01-09 15:49:55
5381
原创 AI首次自主发现人工生命!人类窥见上帝造物
Sakana AI联合MIT、OpenAI等机构提出了全新算法,自动搜索人工生命再达新的里程碑!不需要繁琐手工设计,只通过描述,AI就能发现全新的人造生命体了。就在刚刚,由Transformer八子创立的Sakana AI,联合来自MIT、OpenAI、瑞士AI实验室IDSIA等机构的研究人员,提出了「自动搜索人工生命」的新算法!言归正传,ALife,即「人工生命」,是一门跨学科研究,旨在通过模拟生命的行为、特性和演化过程来理解生命的本质,通常结合了计算科学、生物学、复杂系统科学以及物理学等领域。
2024-12-26 13:46:06
1139
原创 CultureLLM 与 CulturePark:增强大语言模型对多元文化的理解
本文介绍团队刚刚在加拿大温哥华召开的顶会NeurIPS 2024上发表的两篇系列工作:CultureLLM 和CulturePark。此项研究以生成文化数据并训练文化专有模型为主要手段,旨在提升已有基础模型的多文化理解能力,使得其在认知、偏见、价值观、在线教育等不同场景下的文化理解任务上均得到提升。
2024-12-26 13:28:45
1625
空空如也
WeNet进行一些简单的优化rtf大概能到多少?
2022-08-01
-context_score 这个值是什么范围?一般多少合适?
2022-07-22
web socket server支持语言模型吗?
2022-07-22
在流式识别中,如何解决背景噪音带来的干扰?
2022-07-22
热词的文件是什么结构?
2022-07-20
web socket server 怎么启用热词?
2022-07-20
如果想充分理解一个预训练模型的算法,比如aishell预训练模型,应该从哪入手?
2022-07-19
端到端模型对于领域文本优化有什么方案可以在实际应用中使用的?
2022-07-19
WeNet有什么独特的地方吗?比如流识别方面?
2022-07-19
WeNet 转 onnx 的时候要拆成几个模型导出,可以合并为一个吗?
2022-07-19
热词增强和热词唤醒在实现上的区别是什么?
2022-07-05
请问现在工业上用传统的技术多还是端到端的技术多啊?
2022-07-05
aishell example运行stage 4,遇到这个报错,请问是什么问题?
2022-08-03
模型测试时,使用的average model,这是什么方法,有没有参考资料。
2022-08-03
用了aishell的数据集报这种问题的原因是什么?
2022-08-03
想着用自己电脑训模型,理论上可以吗?
2022-08-03
sort是让一个batch内的音频按顺序排列吗?
2022-08-02
最后一个模型量化,在x86上也是有必要的吗?速度会提升多少?
2022-08-02
单并发,用的WeNetspeech离线大模型以及libtorch1.10,rescore和search都在500ms+,,为什么这么慢呢?一般TLG有多大呀?语言模型大小会很影响速度的吧?
2022-08-02
热词标记,但是最后没有实现是因为什么?
2022-08-01
热词输出带上 context 的标志了,是不是通过参数可以控制?还是要改下代码,去掉?
2022-08-01
一般这种websocket 如何做高并发,有没有好的解决方案呢
2022-08-01
请问cmake -B build的时候报这个错,大家有遇到的吗?
2022-08-03
这个热词文件,有行数限制么?比如:3万行,可以么?
2022-08-01
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅