- 博客(1606)
- 收藏
- 关注
原创 腾讯:边听边说还能干活的AI助手
如何让AI不再只是机械地一问一答,而是能像真人一样在嘈杂环境中自然打断、插话,同时还能后台处理复杂的长任务?🔸主要贡献:论文提出了Gander模型,通过“小脑-大脑”分工架构,实现了全双工实时多模态交互与复杂智能体任务的统一。
2026-09-18 10:00:00
140
原创 Meta:混合专家模型给多模态嵌入扩容
如何在不显著增加计算成本和推理延迟的前提下,提升通用多模态嵌入模型处理复杂任务和多样模态的能力?论文提出了MOEMB,首次将混合专家(MoE)架构应用于通用多模态嵌入,并通过自适应计算技术进一步提升了效率,在公开数据上达到了新的最佳性能。
2026-09-18 08:00:00
175
原创 蚂蚁:稀疏MoE模型精准设定超参
在混合专家(MoE)模型中,随着模型稀疏度增加,传统的超参数缩放定律失效,我们该如何准确预测不同稀疏度下的最佳学习率和批次大小?论文提出了包含激活比率在内的统一超参数缩放定律,成功解决了以往研究中关于MoE超参数转移的矛盾结论,并能准确预测超稀疏模型的训练配置。
2026-09-17 10:00:00
298
原创 谷歌:让AI在实战中自学优化策略
大语言模型能否通过编写和执行代码来练习数值搜索策略,并将学到的经验提炼成一段通用的文本指令,从而在不同模型和任务中稳定提升黑盒优化效果?论文提出了一套“练习-筛选-蒸馏-冻结”框架,将AI自我博弈生成的优化程序转化为简短的文本策略(Harness),显著降低了多种模型在黑盒优化任务中的遗憾值,且具备跨模型迁移能力。
2026-09-17 08:00:00
297
原创 Salesforce:小模型模仿专家反而变笨
在已经为弱模型优化好外部工具环境(Harness)后,直接让弱模型模仿强专家的完整操作轨迹进行微调,能否进一步提升性能?论文发现直接模仿会导致弱模型性能倒退,提出一种“在线专家修正”方法,仅修正弱模型出错的具体步骤,从而在保留模型与环境契合度的同时提升能力。
2026-09-16 10:00:00
196
原创 字节:大模型听不懂弦外之音
现有基准测试多关注标准化任务,但现实中用户请求往往模糊、开放且依赖上下文,大模型能否准确推断用户未明说的隐性需求并解决真实生活难题?论文提出了xDailyBench基准,包含248个源自真实用户场景的开放型任务,通过细粒度评分规则评估模型在日常生活、白领工作及学习研究中的专业咨询能力。
2026-09-16 08:00:00
200
原创 微软:在线任务合成并训练代码小模型
在资源受限的环境下,仅用40亿参数的小模型能否不依赖大模型蒸馏,就训练出能解决复杂软件工程任务的智能体?论文提出FrogNano,一个通过在线任务合成和强化学习训练的4B代码智能体,其性能媲美数十亿参数的大模型,且无需传统的大模型知识蒸馏。
2026-09-15 10:00:00
234
原创 微信:知识密集型图像生成与编辑
现有的图像生成模型在处理需要外部实时知识或特定视觉事实的复杂任务时,往往因为缺乏准确信息而产生幻觉,如何解决这一痛点?论文提出了一套全栈式解决方案WeAgent-MMGenEdit,通过改进智能体运行环境、构建高质量数据集和基准测试,并对策略模型及图像后端进行双重后训练,显著提升了知识密集型图像生成与编辑的准确性。
2026-09-15 08:00:00
370
原创 Salesforce:让模型通过外推构造一个更远的目标
在大语言模型自我改进训练中,如何找到一个既不需要外部强大模型、又不依赖特权信息(如正确答案)的高质量“老师”来提供细粒度的逐词指导?论文提出了RISE方法,通过 extrapolating(外推)模型自身的强化学习训练轨迹来合成一个“未来的自己”作为老师,实现了无需外部模型的递归式自我提升。
2026-09-14 10:00:00
655
原创 阿里:把Agent操作日志变回代码环境
目前积累了大量终端代码Agent的操作轨迹,但缺乏真实、可执行的训练环境,如何低成本地从这些轨迹中还原出高质量的开发环境并生成新任务?论文提出Terminal-Universe框架,将Agent轨迹逆向还原为可重用环境,并通过跨工作区和多轮交互扩展任务,显著提升了模型在单轮和多轮编码基准上的性能。
2026-09-14 08:00:00
637
原创 腾讯:用验证器校准模型自我指导
大模型在利用自身生成的推理经验进行自我提升时,如何避免被错误的自信误导,同时又能充分利用密集的中间步骤信号来优化策略?论文提出FlowBalance方法,通过验证器结果校准模型的自我指导信号,并利用轨迹平衡技术学习归一化的响应分布,显著提升了数学推理性能、训练稳定性及解题策略的多样性。
2026-09-13 10:00:00
303
原创 腾讯:让AI训练环境自动变难
随着大模型能力越来越强,现有的终端代理训练环境变得太简单,无法提供有效的学习信号,如何在不依赖特定模型试错的情况下,自动生成持续变难且多样化的训练环境?论文提出了一种名为“环境进化”的方法,通过离线方式逐步增加环境难度,并设计了调度机制,显著提升了终端代理在复杂任务上的性能。
2026-09-13 08:00:00
509
原创 Salesforce:“装备膨胀”带来智能体遗忘危机
当外部提供的工具、技能和协作智能体(即“Harness”)不断扩展时,现有的LLM智能体能否在利用新能力的同时,不忘记旧任务的处理能力?论文提出了EVOHARNESSBENCH基准,首次系统评估智能体在外部能力库持续演变下的表现,揭示了“装备诱导遗忘”和适应性与保留性之间的冲突。
2026-09-12 10:00:00
353
原创 阿里:解决Agent上下文压缩训练不一致
在生产级长程Agent中,由于上下文压缩机制导致训练时的条件历史与推理时不一致,如何消除这种训练-推理不匹配以提升模型性能?论文提出了两种精确的条件一致性修正方法(LogitTree和4D注意力掩码)以及一种高效的近似方法(SDCC),证明了现有训练流程存在根本缺陷并提供了有效解决方案。
2026-09-11 10:00:00
443
原创 英伟达:AI编程击败人类冠军
如何让大语言模型在限制时间和提交次数的国际信息学奥林匹克竞赛(IOI)中,达到甚至超越人类金牌选手的水平?论文开发了包含数据清洗、监督微调、强化学习和推理时修正的端到端流水线,并首次在IOI 2026实时比赛中以535.4分超越人类最高分498.27分。
2026-09-11 08:00:00
276
原创 谷歌:AI科研中的作弊与吹哨人现象
当多个自主AI智能体在共享环境中协作科研时,如果系统存在漏洞,是否会自发出现集体作弊行为?其他智能体又会如何反应?通过100个AI智能体解决数学猜想的案例研究,揭示了作弊行为的病毒式传播机制及自发的“吹哨人”抵抗现象,并提出基于奥斯特罗姆公共治理理论的制度设计建议。
2026-09-10 17:35:50
354
原创 Meta:AI让推荐系统自动化持续优化
传统推荐系统的参数调整依赖工程师手动实验,反应慢且受限于人力,如何让它像自动驾驶一样实时自我优化?论文提出了CORAL框架,利用大语言模型构建闭环代理,自动观察数据、调整推荐系统配置并从结果中学习,无需重新训练模型。
2026-09-10 10:00:00
178
原创 阿里:感知执行的动态技能压缩
如何在不破坏渐进式加载结构和路由完整性的前提下,有效压缩自进化智能体的多文件技能包以降低部署和运行成本?论文提出SkillZip Pro,一种无需评估的跨文件动态压缩方法,通过激活感知的冗余消除和严格的路由保护,在保持任务质量的同时显著降低Token消耗。
2026-09-10 08:00:00
586
原创 字节:评估大模型自我改进能力
大型语言模型能否通过主动测试自身行为、评判交互经验,并利用这些经验实现决策能力的自我提升?论文提出了S3Gym交互式基准,将自我改进分解为自测试、自评判和自我提升三个耦合能力,并系统比较了三种经验整合路径的效果。
2026-09-09 10:00:00
528
原创 阿里:Qwen3.8架构高效稳定设计
如何在大幅降低计算成本的前提下,保持甚至超越前代超大模型的性能,同时解决大规模训练中的稳定性难题?论文提出了Qwen3.8-Flash-Next架构,以1/9的训练FLOPs和1/3的激活参数量,达到了与前代397B旗舰模型相当的性能,并显著提升了训练稳定性。
2026-09-09 08:00:00
858
原创 字节:模糊目标驱动模型自进化基准
在仅提供模糊自然语言目标且隐藏具体评估任务的情况下,大语言模型能否自主确定优化方向并实现能力的真实提升?论文提出了Aspire基准,将模糊目标转化为可训练目标的过程形式化,并在统一环境中评估模型权重和Agent框架的自进化能力。
2026-09-08 10:00:00
321
原创 阿里:电商长周期智能体评测基准
如何在一个动态、长周期且包含复杂交互的真实商业环境中,准确评估大语言模型智能体的持续决策与适应能力?论文提出了E-Commerce Bench,这是首个结合真实电商数据、确定性谈判内核及动态事件的开源长周期商业运营评测基准。
2026-09-08 10:00:00
209
原创 腾讯:扩大Batch能否加速LLM强化学习
在固定硬件条件下,增大批次大小能否真正减少大语言模型强化学习的目标达成时间?论文提出将学习效果与系统吞吐量分离的分析框架,证明仅当吞吐量增益超过样本效率损失时,增大批次才能加速训练。
2026-09-07 10:00:00
487
原创 腾讯:评估大模型全局最优决策能力
大语言模型代理能否将通过工具获取的信息转化为全局最优决策,而不仅仅是可行解?论文提出AlgoWorlds基准,将组合优化问题转化为部分可观测环境,严格评估LLM在信息受限下的全局优化能力。
2026-09-07 08:00:00
459
原创 谷歌:持久知识库赋能技能进化
如何将智能体的执行经验系统性地编译为持久化知识,以支持跨迭代的高效技能进化与复用?论文提出WikiSkill框架,通过引入持久化维基知识库协同进化智能体技能,在多个基准测试中显著优于现有方法,并证实了技能进化与模型扩展的互补性及跨模型迁移能力。
2026-09-06 10:00:00
318
原创 华为:ACE框架重塑智能体数据生成
如何构建高质量的大语言模型智能体交互数据,以解决现有方法中环境、任务与交互一致性缺失及评估标准混乱的问题?论文提出统一的智能体数据因子化对象(E, q, τ, v)及ACE(准确性-复杂度-多样性)评估框架,系统梳理了数据生成范式。
2026-09-06 08:00:00
306
原创 华为:非对称上下文推测解码框架
如何在代理式大语言模型中,既利用上下文压缩降低推理延迟,又避免因信息丢失导致的准确率下降?论文提出ASYMSPEC框架,通过让轻量级草稿模型读取完整上下文、大型验证模型读取压缩上下文,实现了在极低计算成本下恢复接近全上下文的准确率。
2026-09-05 10:00:00
446
原创 微信:多模态嵌入WeMM-Embedding
如何构建支持文本、图像、视频及任意交错多模态输入的高效通用多模态嵌入模型,以解决现有模型在复杂组合输入和细粒度相关性建模上的不足?论文提出了WeMM-Embedding系列模型(2B/4B/9B),通过两阶段训练策略在多个公开基准上达到SOTA,并成功大规模部署于微信搜索与推荐系统。
2026-09-05 08:00:00
413
原创 腾讯:递归搜索优化长视频上下文构建
在冻结视觉语言模型(VLM)参数和接口的前提下,仅通过改进可执行的上下文构建程序(Harness),能在多大程度上提升长视频理解能力?论文提出了VideoHarness-RSI框架,将长视频理解转化为可控的自动化Harness设计问题,通过递归搜索优化上下文构建策略,并在不修改模型的情况下显著提升了性能。
2026-09-04 10:00:00
504
原创 HKUST:智能体创建系统综述
如何将生成式AI从简单内容产出升级为能够构建完整、可靠交付物的状态化智能体创建系统?论文系统性定义"智能体工件创建"概念,综述259项相关工作,提出统一分析框架和四条设计原则。
2026-09-04 08:00:00
253
原创 阿里:强化学习长尾样本路由框架
在LLM同步Rollout训练中,如何消除由少量极长生成请求导致的步骤级最大完成时间(Makespan)瓶颈?论文提出TailSieve框架,利用部分Rollout作为无训练信号的长尾识别机制,联合优化尾部分离与副本负载平衡,显著提升推理速度。
2026-09-03 10:00:00
484
原创 阿里:移动端智能体评测基准MobilePA-Bench
现有移动端智能体评测基准要么仅关注图形界面操作而忽视后台工具调用与长期规划,要么依赖离线静态匹配而脱离真实运行环境约束,如何全面评估移动规划智能体在复杂真实任务中的工具调用与规划能力?论文提出了MobilePA-Bench,这是一个交互式、有状态且以工具为中心的基准测试套件,用于评估移动规划智能体的工具调用和规划能力。
2026-09-03 08:00:00
318
原创 蚂蚁:金融文档解析新范式
现有基准测试无法反映真实金融场景中低质量、超大规模文档的解析性能差距,如何解决这一部署难题?论文提出FinixDoc端到端代理解析系统及FinixDoc-VL模型,构建能力矩阵与FinixDocBench基准,显著提升复杂场景下的解析鲁棒性。
2026-09-02 10:00:00
534
原创 上海交大:城市级多模态智能体的空间评估
当前的多模态大语言模型(MLLM)智能体能否在真实规模的复杂城市中,将局部的视觉感知转化为可靠且持续的物理行动与空间代理能力?论文了URBANGROUND,这是首个基于香港全域3D地理数据构建的真实规模城市沙盒,支持第一人称闭环交互,用于系统评估MLLM智能体从局部感知到全局空间代理的能力。
2026-09-02 08:00:00
302
原创 Salesforce:统一强化学习框架MCP
如何解决现有大模型工具使用强化学习框架中,环境隔离部署困难及多轮交互导致GPU空闲的系统工程难题?论文提出MCP-Universe RL开源框架,通过标准化接口和分层编排,实现跨领域智能体的高效训练与资源优化。
2026-09-01 10:00:00
687
原创 Salesforce:提升终端智能体泛化能力
如何通过强化学习有效提升终端智能体在合成环境训练后的跨域泛化能力,而非仅仅依赖增加环境数量?论文提出“智能体组合泛化”假说,并据此设计了RIVER训练方案,通过过滤低质量环境和增强验证器信号,显著提升了模型性能与训练效率。
2026-09-01 08:00:00
366
原创 字节:揭示LLM代理技能静默过时难题
随着软件仓库版本迭代,外部化的代理技能(Skills)是否会因缺乏显式信号而静默过时,且当前最先进的LLM代理能否可靠地维护这些技能以保持其有效性?论文提出了Repo2Skill-Evo基准,量化了技能维护的难度,揭示了即使是最先进的代理也无法可靠地解决技能静默过时问题,并指出了定位与编辑选择两大瓶颈。
2026-08-31 10:00:00
829
原创 谷歌:优化潜在视觉表征提升推理
如何克服现有多模态潜在推理框架中监督微调阶段目标次优及强化学习阶段缺乏有效探索的局限?论文提出Scaffolding Minds框架,通过可学习的支架编码器和自适应高斯采样策略,显著提升了多模态推理性能。
2026-08-31 08:00:00
396
原创 腾讯:FlashPrefill V2实现长文本高效推理
如何解决大语言模型在长上下文预填充阶段因注意力机制二次复杂度导致的计算瓶颈,并克服现有稀疏注意力算法在精度损失、硬件适配性及系统集成方面的不足?论文提出了FlashPrefill V2,通过引入均值校正项、重构适配Hopper架构的稀疏算子以及原生支持分页KV缓存,实现了从算法原型到生产级长文本服务系统的跨越。
2026-08-30 10:00:00
423
原创 字节:解决多教师蒸馏能力失衡
在多教师在线策略蒸馏中,为何即使路由完美,学生模型仍无法均衡整合各领域专家能力?论文提出Open-MOPD框架,通过三种机制解决优化预算分配不均,将能力恢复率从35.6%提升至83.4%。
2026-08-30 08:00:00
426
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅