自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+

大模型任我行的博客

每日分享大模型论文,紧跟AI技术最前线!

  • 博客(1486)
  • 收藏
  • 关注

原创 腾讯:行为中心表征助力Agent演化

如何在大型且复杂的AI Agent Harness代码库中,准确地将自然语言描述的修改需求定位到分散的源代码位置?论文提出了Harness Handbook,一种自动生成的以行为为中心的代码表征,结合行为引导的渐进式披露机制,显著提升了代码修改的定位准确性和规划质量。

2026-07-20 10:00:00 16

原创 蚂蚁:智能体安全护栏SingGuard-NSFA

如何系统性地防御从文本生成转向实际操作的智能体AI所面临的注入、数据窃取及工具滥用等运营级威胁?论文提出SingGuard-NSFA框架,包含基于CIA三元组的NSFA风险分类体系、覆盖133种语言的大规模基准测试,以及结合生成式推理与实时分类的双模式护栏模型。

2026-07-20 08:00:00 29

原创 腾讯:预测散度掩码提升LLM强化学习

在大语言模型强化学习中,当使用分布散度作为信任区域邻近性判据时,如何设计与之对齐的方向性判据以解决传统采样比率判据的不一致问题?论文提出预测散度掩码,通过解析推导散度的方向导数并设计轻量级估计器,实现了与散度变化严格对齐的更新方向控制,显著提升了训练稳定性与效果。

2026-07-19 10:00:00 446

原创 阿里:解耦认知控制实现通用导航

如何解决现有视觉语言导航模型因单体策略导致的坐标漂移、长尾语义处理差及缺乏可解释性问题?论文提出ABot-N1,通过慢快双系统架构解耦认知与控制,利用思维链和像素目标实现鲁棒、通用且可解释的导航。

2026-07-19 08:00:00 434

原创 阿里:构建具身智能通用操作系统

如何解决长周期具身智能体在推理执行、跨形态泛化及持久多模态记忆方面的缺失?论文提出ABot-AgentOS通用机器人代理操作系统,引入EmbodiedWorldBench基准及支持终身自进化的多模态图记忆系统。

2026-07-18 10:00:00 471

原创 Meta:自引导测试时训练优化长文本

如何解决长上下文测试时训练中因全量训练昂贵且随机采样噪声大导致模型性能下降的问题?论文提出自引导测试时训练方法S-TTT,利用模型自身筛选关键证据片段进行适配,显著提升长文本推理准确率。

2026-07-18 08:00:00 332

原创 Meta:主动记忆干预长程智能体

如何解决长程任务中关键决策状态随轨迹增长而失效的行为状态衰减问题?论文提出将记忆视为主动干预机制,通过独立记忆智能体选择性注入提醒以提升长程任务性能。

2026-07-17 10:00:00 224

原创 腾讯:长时终端任务密集评测基准

现有终端基准仅关注短时任务和最终结果,如何有效评估智能体在长时复杂任务中的中间进展与真实能力?论文提出Long-Horizon-Terminal-Bench,通过子任务级密集奖励机制精准量化智能体在长时终端任务中的部分进展与失败模式。

2026-07-17 08:00:00 301

原创 字节:无界正非对称优化破解探索困境

如何在强化学习中最大化模型探索能力的同时防止训练不稳定?论文提出无界正非对称优化(UP)方法,通过停止梯度算子重构优化过程,在保持训练稳定的前提下彻底释放了正确推理路径的探索能力。

2026-07-16 10:00:00 398

原创 英伟达:动态双焦RoPE高效长文扩展

如何在不微调且保持短文本性能的前提下,实现大模型零样本长上下文的高效扩展?论文提出Jet-Long方法,通过动态双焦RoPE与融合算子实现免训练、高精度且低开销的长文本推理。

2026-07-16 08:00:00 291

原创 英伟达:三模态统一自回归与扩散解码

如何在一个模型中统一自回归与扩散范式以兼顾生成质量与推理效率?论文提出Nemotron-Labs-Diffusion三模态语言模型,通过联合训练实现自回归、扩散及自投机解码的统一,在精度和吞吐量上均超越现有开源模型。

2026-07-15 10:00:00 600

原创 阿里:智能体主动导航结构化记忆

如何让智能体摆脱被动检索限制,主动且精准地利用长期用户记忆?论文提出NapMem框架,将长期记忆重构为结构化动作空间,通过强化学习训练智能体主动导航多层级记忆金字塔。

2026-07-15 08:00:00 614

原创 字节:揭示智能体环境学习缩放律

大模型智能体在部署后从真实世界环境中持续学习的过程是否遵循可预测的数学缩放规律?论文提出EdgeBench基准并首次发现智能体环境学习性能随交互时间呈现高精度的Log-Sigmoid缩放律,且学习速度每三个月翻倍。

2026-07-14 10:00:00 635

原创 英伟达:混合MoE模型高效压缩部署

如何在大幅降低混合架构大模型推理成本的同时保持其下游任务性能?论文提出Iterative Puzzle压缩框架,将Nemotron-3-Super压缩为Puzzle-75B-A9B,在保持精度的前提下实现交互式服务吞吐量翻倍及百万级上下文并发提升。

2026-07-14 08:00:00 381

原创 微软:极简智能体技能自进化框架

如何构建一个理论完备且组件必要的最小可行智能体技能优化流水线?论文提出SkillOpt-Lite极简框架,通过零阶优化与文件中心哲学实现比复杂基线更快更强的技能及脚手架自进化。

2026-07-13 10:00:00 373

原创 Meta:模块化代码生成强化学习

大语言模型如何在基础策略成功率极低时,以较低GPU成本解决高难度编程问题?论文提出DecompRL算法,通过学习分层模块化代码生成与重组,将搜索瓶颈从昂贵GPU推理转移至廉价CPU评估,显著提升高算力预算下的难题求解率。

2026-07-13 08:00:00 408

原创 Meta:FADE自适应优势函数优化RL

如何解决大语言模型强化学习后训练中普遍存在的训练不稳定与生成多样性崩溃问题?论文提出统一分析框架解构策略梯度权重,并设计出自适应优势函数FADE以动态平衡探索与利用。

2026-07-12 10:00:00 371

原创 Meta:扩散模型加速推理重排序

如何将自回归推理重排序器转换为块扩散模型,在大幅提升推理速度的同时保持排序精度?论文提出Diffusion-GR2转换方案,通过三阶段训练使块扩散重排序器在保持近AR精度的同时实现2.4至3.5倍解码加速。

2026-07-12 08:00:00 457

原创 阿里:让记忆直接驱动智能体执行

GUI智能体在长程任务中应如何从被动记录转向主动状态维护以避免操作重复或遗漏?论文提出主动任务驱动记忆ATMem及STR-GRPO算法,将记忆转化为可学习的执行状态并构建DataScope基准。

2026-07-11 10:00:00 471

原创 字节:面向真实世界复杂性的Seed2.0

大语言模型如何从解决竞赛题转向可靠完成长周期、多步骤的真实世界复杂任务?论文发布Seed2.0系列模型,在保持前沿性能的同时大幅降低成本,并构建了面向真实经济科研价值的评估体系。

2026-07-11 08:00:00 356

原创 美团:Agent可插拔弹性上下文管理

如何解决智能体长轨迹任务中现有上下文管理方法不可逆且不灵活导致的信息丢失问题?论文提出即插即用的自适应上下文弹性器ACE,通过无损存储与动态编排实现历史信息的可逆弹性调用。

2026-07-10 10:00:00 345

原创 字节:大模型策略护栏评测基准

现有的安全护栏能否根据上下文中提供的特定应用策略,准确识别用户与模型交互中的违规行为?论文提出了SafePyramid分层基准,系统评估了大模型在上下文策略护栏任务中理解规则、解析依赖及适应新框架的能力。

2026-07-10 08:00:00 413

原创 Meta:多轮交互编程智能体基准SWE-Together

如何构建能真实反映人机协作过程并量化用户干预成本的编程智能体评估基准?论文提出SWE-Together基准,将真实会话重构为可验证的多轮交互任务,并引入用户修正指标评估协作体验。

2026-07-09 10:00:00 623

原创 阿里:免训练视觉语言模型技能工具自进化

如何在不更新权重的情况下让冻结的视觉语言模型自主适应新任务?论文提出Dynamo框架,通过小样本自诊断动态生成推理技能与视觉工具库以提升性能。

2026-07-09 08:00:00 189

原创 Meta:通用终端智能体评测基准

如何全面评估大模型在命令行环境中执行通用计算机任务及专业科学工作流的能力?论文提出了TUA-Bench,首个涵盖日常办公与专家级科研任务的通用终端智能体评测基准。

2026-07-08 10:00:00 557

原创 Meta:双焦扩散模型兼顾质量与速度

离散扩散语言模型如何在不牺牲生成质量的前提下兼容KV缓存以实现高效推理?论文提出双焦扩散模型范式R2LM,通过非对称双向上下文机制同时实现高质量生成与高吞吐推理。

2026-07-08 08:00:00 460

原创 英伟达:双塔扩散模型提速生成

如何解决现有扩散语言模型因单一网络兼顾上下文表示与去噪而导致容量受限及生成吞吐低的问题?论文提出Nemotron-TwoTower架构,通过解耦冻结AR上下文塔与可训练扩散去噪塔,在保持98.7%基线质量的同时实现2.42倍生成吞吐提升。

2026-07-07 10:00:00 339

原创 字节:适配MHC架构的推测解码

如何解决DeepSeek-V4的多超连接架构与现有块级推测解码方法不匹配导致草稿接受率下降的问题?论文提出HyperDFlash框架,通过MHC对齐优化显著提升DeepSeek-V4的推测解码速度与接受长度。

2026-07-07 08:00:00 377

原创 阿里:编码智能体奖励验证体系

随着编码智能体生成能力增强,如何设计可靠且能持续进化的验证奖励信号以解决奖励欺骗问题?论文提出验证器需与生成器协同进化的核心理念,并针对四类任务构建了定制化验证体系以提升模型真实能力。

2026-07-06 10:00:00 626

原创 阿里:直接策略驱动的大模型安全对齐

如何解决大模型安全对齐中自然语言策略更新快与高质量标注数据获取慢之间的时效性错配问题?论文提出PolicyAlign框架,无需人工标注数据即可将自然语言安全策略直接内化为模型参数,实现快速、可扩展的安全对齐。

2026-07-06 08:00:00 209

原创 Meta:智能体自主构建高质量数据

如何让AI智能体像数据科学家一样自主迭代生成并优化高质量合成训练数据?论文提出Autodata框架及Agentic Self-Instruct方法,通过智能体闭环与元优化显著提升合成数据质量与模型训练效果。

2026-07-05 10:00:00 378

原创 阿里:语言世界模型赋能通用智能体

如何构建基于语言模型的通用环境模拟器,并探索其提升智能体能力的有效范式?论文提出覆盖七大领域的原生语言世界模型Qwen-AgentWorld,验证了其作为环境模拟器和智能体基座的双重价值。

2026-07-05 08:00:00 708

原创 百度:渐进多令牌预测加速文档解析

如何解决视觉语言模型在文档解析任务中因自回归解码导致的推理延迟高及多令牌预测深层优化不稳定的问题?论文提出P-MTP框架,通过渐进课程损失和置信度门控动态起草机制,实现文档解析高达5倍加速且精度无损。

2026-07-04 10:00:00 327

原创 蚂蚁:高效多模态搜索智能体框架

如何解决现有多模态搜索智能体在训练效率、证据可靠性及系统实用性方面面临的瓶颈?论文提出SimpleSearch-VL框架,通过自适应采样、证据验证及自摘要机制,以极少数据实现媲美顶级闭源模型的性能。

2026-07-04 08:00:00 711

原创 百度:R-SWA实现无限长文档解析

如何解决端到端OCR模型在长序列生成时KV缓存无限增长导致显存爆炸和推理变慢的问题?论文提出参考滑动窗口注意力机制R-SWA,使模型能在恒定显存下一次性解析数十页文档且性能更优。

2026-07-03 10:00:00 442

原创 AllenAI:终端智能体强化学习训练配方

如何构建简单有效的开源数据与强化学习配方以训练高性能小参数终端智能体?论文提出TMAX开源RL训练配方及包含1.46万环境的大规模数据集,使9B模型在Terminal-Bench上超越同类开源模型并逼近闭源前沿水平。

2026-07-03 08:00:00 424

原创 蚂蚁:策略自适应多模态安全护栏

如何解决现有多模态安全护栏依赖固定分类体系、无法适应运行时动态策略变更及推理效率低下的问题?论文提出了支持运行时策略自适应和快慢动态推理的多模态护栏模型SingGuard,并构建了 comprehensive 评测基准。

2026-07-02 10:00:00 740

原创 腾讯:混合环境训练手机智能体

如何训练开源模型使其在真实手机上可靠完成任务,而非仅提升界面感知或基准测试分数?论文提出PhoneBuddy训练方案,通过结合真实应用与可重置模拟环境进行混合强化学习,显著提升开源模型在真机任务中的成功率。

2026-07-02 08:00:00 329

原创 美团:DEAR精准蒸馏推理证据

在策略蒸馏中,如何发现并转移那些学生模型自信但错误的实质性推理证据?论文提出DEAR方法,通过两阶段机制同时捕获决策与证据token,显著提升推理蒸馏效果。

2026-07-01 10:00:00 303

原创 阿里:置信解码缓解对齐扰动

大语言模型最终层的对齐扰动是否会损害复杂推理能力,以及如何在不训练的前提下缓解这一问题?论文揭示了LLM“猜测-精炼-扰动”的动态机制,并提出无需训练的置信解码策略,通过动态选择熵谷层有效缓解对齐税并提升推理性能。

2026-07-01 08:00:00 216

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除