顶会论文
文章平均质量分 88
该专栏主要整理顶会相关的LLM文章
UnknownBody
AI博士,最近一直follow大模型相关论文,每日会更新学术界论文的进展。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
2025_NIPS_Online Ad Procurement in Non-stationary Autobidding Worlds
如今,在线广告主通过与自动竞价平台交互来采购数字广告曝光:广告主通过设置预算、目标投资回报率、最高点击成本等控制杠杆,传达高层级采购目标。之后,广告平台代表广告主进行曝光采购,并向广告主报告最终的采购转化结果(如点击量)。在实际操作中,广告主可能仅能获取平台采购细节的极少信息,且采购结果受季节性模式、偶发系统故障和市场趋势等非平稳因素影响,导致广告主难以有效优化杠杆决策。原创 2026-06-25 07:30:00 · 19 阅读 · 0 评论 -
2025_NIPS_Multi-Agent Meta-Reinforcement Learning: Sharper Convergence Rates with Task Similarity
多智能体强化学习(MARL)主要聚焦于孤立解决单个任务,而在实际场景中,环境往往是动态演化的,需要处理大量相关任务。本文研究了元学习在联合解决多个MARL任务时的优势,首次为广泛的基础MARL场景建立了元学习的理论结果,包括双人零和马尔可夫博弈和马尔可夫势博弈中的纳什均衡学习,以及一般和马尔可夫博弈中的粗相关均衡学习。在自然的任务相似性定义下,我们证明:与孤立学习每个任务相比,元学习能以可证明的更优收敛速率逼近各类博弈论解概念。作为重要的中间步骤,我们提出了多种具有初始化依赖收敛保证的MARL算法。原创 2026-06-24 09:30:00 · 22 阅读 · 0 评论 -
2025_NIPS_Efficient Diffusion Policies For Offline Reinforcement Learning
该研究聚焦离线强化学习(Offline RL)中的策略参数化问题,针对现有扩散模型策略(如Diffusion-QL)存在的计算效率低下、与极大似然类RL算法不兼容的核心缺陷,提出了高效扩散策略(EDP)。核心背景:离线强化学习需从离线数据集学习最优策略,但传统策略(如对角高斯分布)难以拟合复杂多模态数据分布;Diffusion-QL引入扩散模型提升了性能,却因依赖长马尔可夫链采样导致训练耗时(达5天),且无法适配需 tractable 对数似然的策略梯度算法(如IQL、CRR)。EDP核心设计。原创 2026-06-24 08:30:00 · 23 阅读 · 0 评论 -
2025_NIPS_Instructing Goal-Conditioned Reinforcement Learning Agents with Temporal Logic Objectives
目标条件强化学习(RL)是一种通过达成多样化目标来学习通用技能的强大方法。然而,当目标由以线性时序逻辑(LTL)形式语言编写的时序扩展指令指定时,它在任务条件策略方面存在局限性。现有寻找满足LTL规范的策略的方法,依赖于在训练期间采样大量LTL指令,以适应推理时未见过的任务。但这些方法无法保证对分布外的LTL目标具有泛化能力,而这些分布外目标的复杂度可能更高。在本文中,我们提出一种新方法来应对这一挑战。我们表明,无需在LTL任务空间上进行额外训练,简单的目标条件RL智能体就能被指导遵循任意LTL规范。原创 2026-06-24 07:30:00 · 16 阅读 · 0 评论 -
2025_NIPS_No-Regret Online Reinforcement Learning with Adversarial Losses and Transitions
本文聚焦对抗性马尔可夫决策过程(MDPs)的在线强化学习问题,解决了现有算法无法同时处理对抗性损失和对抗性转移的局限。现有算法在转移函数固定时能达到OTOT遗憾界,但对抗性转移会导致无遗憾学习不可行。本文提出系列算法,让遗憾界随转移恶意程度CPC^PCP平滑增长,同时适配更简单的环境。现有对抗性马尔可夫决策过程(MDPs)的在线学习算法,即使损失函数由对手任意选择,在TTT轮交互后仍能达到OTOT的遗憾界,但前提是转移函数必须固定。原创 2026-06-23 12:30:00 · 22 阅读 · 0 评论 -
2025_NIPS_OFCOURSE: A Multi-Agent Reinforcement Learning Environment for Order Fulfillment
本文针对全球电子商务增长背景下订单履行(从下单到配送全流程)的高效低成本需求,聚焦其多阶段、决策 interdependent(相互依赖)、信息动态揭示的核心挑战,提出了基于多智能体强化学习(MARL)的一体化解决方案,并设计了对应的仿真环境OFCOURSE。问题背景:订单履行涉及订单处理、打包提货、仓储、订单合并、最后一公里配送等多个相互关联的决策阶段,传统研究多单独解决各子问题,易导致全局次优;且缺乏标准化仿真环境支持全流程MARL研究。核心方法。原创 2026-06-22 11:30:00 · 22 阅读 · 0 评论 -
2025_NIPS_Robust Knowledge Transfer in Tiered Reinforcement Learning
本文研究分层强化学习(Tiered Reinforcement Learning)框架,这是一种并行迁移学习架构,其目标是在并行求解低层级(源)任务与高层级(目标)任务的同时,将源任务的知识迁移至目标任务,以降低目标任务的探索风险。与现有研究不同,我们不预设低层级与高层级任务具有相同的动力学或奖励函数,而是聚焦于无任务相似性先验知识下的鲁棒知识迁移问题。我们为目标实现识别出一个自然且必要的条件,称为“最优价值优势(Optimal Value Dominance)”。原创 2026-06-22 09:30:00 · 105 阅读 · 0 评论 -
2025_NIPS_Transformer-based Planning for Symbolic Regression
该研究聚焦于符号回归(SR)任务——即从数据中挖掘可解释的数学表达式,其核心挑战在于平衡模型拟合精度、复杂度与泛化能力,同时解决传统方法效率低或目标偏差的问题。背景与现有方法局限传统遗传编程(GP)类方法:需为每个数据集从头搜索,计算成本高、收敛慢,易过拟合。现有基于预训练Transformer的SR方法:利用大规模合成数据预训练,推理速度快,但依赖文本生成的token级交叉熵损失,忽视了符号回归核心的拟合精度、表达式复杂度等目标,导致生成结果次优。原创 2026-06-21 09:30:00 · 27 阅读 · 0 评论 -
2025_NIPS_Efficient Potential-based Exploration in Reinforcement Learning using Inverse Dynamic B...
该研究聚焦强化学习中的探索效率与策略不变性问题,针对传统基于势能的奖励塑造(PBRS)依赖人工设计、认知偏差明显,以及现有内在奖励探索方法依赖计数型项、可扩展性差等缺陷,提出了一种名为LIBERTY(expLoration vIa Bisimulation mEtRic-based sTate discrepancY)的端到端探索框架。核心思路是利用逆动态互模拟度量。原创 2026-06-21 10:30:00 · 24 阅读 · 0 评论 -
2025_NIPS_Adjustable Robust Reinforcement Learning for Online 3D Bin Packing
设计在线3D装箱问题(3D-BPP)的有效策略是一项长期挑战,主要源于输入箱子序列的不可预测性和严格的物理约束。尽管当前基于深度强化学习(DRL)的在线3D-BPP方法在优化箱子序列分布下的平均性能方面取得了良好成果,但在某些最坏情况可能出现的现实场景中往往表现不佳。标准鲁棒DRL算法倾向于过度优先优化最坏情况性能,却以牺牲正常问题实例分布下的性能为代价。为解决这些问题,我们首先引入一种基于排列的攻击者,用于研究现有DRL基方法和启发式方法在在线3D-BPP中的实际鲁棒性。原创 2026-06-21 08:30:00 · 28 阅读 · 0 评论 -
2025_NIPS_Alternating Updates for Efficient Transformers
已有充分研究表明,深度Transformer网络的规模扩大能带来质量和性能的提升。然而,这种规模增长往往伴随着计算成本和推理延迟的激增。本文提出交替更新(AltUp)——一种易于实现的方法,可在不增加计算负担的前提下提升模型容量。AltUp能够加宽学习到的表示(即token嵌入),同时仅导致可忽略的延迟增加。其核心机制是在每层对加宽表示的一个子块进行操作,并通过“预测-修正”机制更新未激活的子块。原创 2026-06-21 07:30:00 · 22 阅读 · 0 评论 -
2025_NIPS_Large Language Models are Visual Reasoning Coordinators
视觉推理需要对世界的多模态感知和常识认知。近年来,已有多个视觉语言模型(VLMs)被提出,它们在不同领域具备出色的常识推理能力。然而,如何利用这些互补VLMs的集体力量尚未得到充分探索。现有方法(如集成学习)仍难以聚合这些模型并实现理想的高阶通信。在本文中,我们提出Cola——一种新型范式,通过协调多个VLMs完成视觉推理任务。核心洞见是:大型语言模型(LLM)可通过自然语言通信高效协调多个VLMs,充分利用它们独特且互补的能力。原创 2026-06-20 12:30:00 · 20 阅读 · 0 评论 -
2025_NIPS_General Munchausen Reinforcement Learning with Tsallis Kullback-Leibler Divergence
许多强化学习中的策略优化方法会引入与先前策略的KL(Kullback-Leibler)散度,以防止策略变化过快。这一思想最初在保守策略迭代(Conservative Policy Iteration)的开创性论文中提出,TRPO和蒙乔森价值迭代(Munchausen Value Iteration, MVI)等算法对此进行了近似实现。本文延续这一研究方向,探讨了一种广义KL散度——Tsallis KL散度。基于q-对数定义的Tsallis KL散度是严格的泛化形式:当q=1时,它等价于标准KL散度;原创 2026-06-20 11:30:00 · 21 阅读 · 0 评论 -
2025_NIPS_Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language...
程序合成是一个长期研究的领域,近年来的研究方法聚焦于直接利用大语言模型(LLMs)的能力生成代码。编程基准测试(通过精心设计的合成问题和测试用例)被用于衡量各类LLM的代码合成性能。然而,这些测试用例在数量和质量上均存在局限,难以全面评估生成代码的功能正确性。现有基准测试的这一缺陷引发了如下核心问题:在LLM时代,生成的代码真的正确吗?为解答这一问题,我们提出了EvalPlus——一个用于严格评估LLM合成代码功能正确性的代码合成评估框架。原创 2026-06-19 11:30:00 · 27 阅读 · 0 评论 -
2025_NIPS_Setting the Trap: Capturing and Defeating Backdoors in Pretrained Language Models throu...
在自然语言处理领域,主流方法是利用本地样本对预训练语言模型(PLMs)进行微调。近期研究表明,PLMs易受后门攻击——攻击者可通过操控少量训练样本嵌入恶意预测行为。本研究旨在设计一种抗后门微调流程,无论微调数据集是否包含毒样本,均能生成无后门模型。为此,我们提出并在原始PLMs中集成蜜罐模块,该模块专门用于独家吸收后门信息。我们的设计灵感源于以下观察:PLMs的低层表示包含充足的后门特征,同时仅携带极少的原始任务信息。因此,我们可通过对蜜罐模块获取的信息施加惩罚,抑制主干网络在微调过程中形成后门。原创 2026-06-19 10:30:00 · 21 阅读 · 0 评论 -
2025_NIPS_Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning
在本文中,我们证明了汤普森采样(Thompson Sampling)在多种强化学习场景下的首个贝叶斯遗憾界。我们通过离散的替代环境集合简化学习问题,并利用后验一致性对信息比进行精细化分析。这导致在时变强化学习问题中,我们得到了一个阶为OHdl1TOHdl1T的上界,其中H为episode长度,dl1d_{l_1}dl1是环境空间的Kolmogorovl1l_1l1维度。随后,我们在多种场景(如表格型、线性和有限混合模型)中给出了dl1。原创 2026-06-20 09:30:00 · 22 阅读 · 0 评论 -
2025_NIPS_Density of States Prediction of Crystalline Materials via Prompt-guided Multi-Modal Tra...
该研究聚焦于晶体材料的态密度(DOS,包括声子DOS和电子DOS)预测问题。态密度是晶体材料的光谱特性,对理解材料的导电性、热容量等关键性质至关重要,但传统密度泛函理论(DFT)计算成本高昂。现有机器学习方法多专注于单值材料特性预测,且忽略了态密度的核心本质——其由材料本身和能量水平共同决定,未充分整合异质信息。为此,研究提出将晶体材料(通过图神经网络编码原子和结构信息)与能量水平作为异质输入模态;利用交叉注意力机制建模材料与能量水平的复杂关系,通过自注意力机制整合能量间的全局信息;原创 2026-06-20 08:30:00 · 20 阅读 · 0 评论 -
2025_NIPS_HotBEV: Hardware-oriented Transformer-based Multi-View 3D Detector for BEV Perception
鸟瞰图(BEV)感知在自动驾驶系统中起着关键作用,涉及从俯视角度对目标进行准确高效的检测与跟踪。为实现自动驾驶场景下的实时决策,低延迟计算至关重要。尽管近年来基于Lift-Splat-Shoot(LSS)或Transformer的BEV检测方法在提升检测精度方面取得了进展,但这些方法巨大的计算和内存负担,在车载多任务同时运行时会增加系统崩溃的风险。遗憾的是,关于高效BEV检测器范式的研究文献匮乏,更鲜有能实现实际速度提升的方案。原创 2026-06-19 08:30:00 · 23 阅读 · 0 评论 -
2025_NIPS_Langevin Quasi-Monte Carlo
Langevin 蒙特卡洛(LMC)及其随机梯度版本是从复杂高维分布中采样的强大算法。为了从密度为πθ∝exp−Uθπθ∝exp−Uθ))的分布中采样,LMC 通过沿梯度方向∇U\nabla U∇U迈出一步并添加高斯扰动,迭代生成下一个样本。目标分布π\piπ的期望通过对 LMC 样本求平均来估计。在普通蒙特卡洛方法中,众所周知,用低偏差序列等拟随机样本替代独立随机样本可以大幅降低估计误差。在本文中,我们表明,使用拟随机样本也可以降低 LMC 的估计误差。原创 2026-06-20 10:30:00 · 147 阅读 · 0 评论 -
2025_NIPS_CoLLAT: On Adding Fine-grained Audio Understanding to Language Models using Token-Level...
该研究针对传统音频理解模型难以识别未训练类别、无法保留预训练语言模型文本理解能力、对含多音频概念的复杂音频片段理解不足等问题,提出了框架。其核心是在冻结预训练文本编码器(如CLIP文本编码器)的前提下,通过对比学习实现音频-文本的细粒度对齐,从而构建兼具强音频理解能力与文本编码器原有优势的模型。原创 2026-06-20 07:30:00 · 19 阅读 · 0 评论 -
2025_NIPS_Post Hoc Explanations of Language Models Can Improve Language Models
该文章聚焦于少样本学习(Few-Shot Learning, FSL)领域,针对现有方法在利用支持集信息时存在的“信息利用不充分”和“跨样本干扰”问题,提出了一种基于“支持集特征校准与自适应聚合”的新型框架。文章首先分析了FSL中类别内特征一致性与类别间特征区分度的核心需求,指出传统方法(如原型网络)仅依赖简单平均聚合支持集特征,易受噪声样本影响且无法捕捉样本间细粒度关联;进而通过设计特征校准模块、动态注意力聚合机制,实现对支持集样本的精准加权与信息融合,并结合元学习范式优化模型泛化能力。原创 2026-06-19 07:30:00 · 24 阅读 · 0 评论 -
2025_NIPS_ReTR: Modeling Rendering Via Transformer for Generalizable Neural Surface Reconstruction
可泛化神经表面重建技术近年来受到了广泛关注。然而,由于所采用的体渲染过程过于简化,这些方法面临着深度分布置信度低和表面推理不准确的局限性。在本文中,我们提出了Reconstruction Transformer(ReTR),这是一种新颖的框架,它利用Transformer架构重新设计渲染过程,实现复杂的渲染交互建模。该框架引入了可学习的元射线令牌(meta-ray token),并利用交叉注意力机制模拟渲染过程与采样点的交互,从而渲染出观测颜色。原创 2026-06-15 13:30:00 · 21 阅读 · 0 评论 -
2025_NIPS_Birth of a Transformer: A Memory Viewpoint
文章从记忆视角研究Transformer的内部机制,核心聚焦Transformer如何平衡全局知识(如语法规则)与上下文特定知识(如语境中的新词关联)的学习。通过构建包含全局二元组和上下文特定二元组的合成数据集,作者对简化的两层Transformer进行实证分析与理论推导,发现模型先快速学习全局二元组,再通过“归纳头”机制缓慢掌握上下文二元组预测能力。原创 2026-06-18 12:30:00 · 103 阅读 · 0 评论 -
2025_NIPS_Effectively Learning Initiation Sets in Hierarchical Reinforcement Learning
该研究聚焦于分层强化学习(HRL)中启动集(Initiation Sets)的有效学习问题。启动集是指选项(Option)可执行的状态集合,其学习质量直接影响HRL智能体的任务性能,但传统方法因存在数据非平稳性、时间信用分配困难和悲观偏差三大核心问题,导致启动集学习不准确、规模萎缩,进而制约下游任务表现。启动价值函数(IVF):基于通用价值函数(GVF),预测从某状态执行选项成功的概率,通过时序差分(TD)方法学习,可适应政策(Policy)变化,解决数据非平稳性和时间结构利用不足的问题;原创 2026-06-18 11:30:00 · 114 阅读 · 0 评论 -
2025_NIPS_CAMEL: Communicative Agents for “Mind“ Exploration of Large Language Model Society
聊天式语言模型的快速发展在复杂任务解决方面取得了显著进展。然而,它们的成功严重依赖人类输入来引导对话,这一过程既具挑战性又耗时。本文探索了构建可扩展技术以促进通信智能体间自主协作的潜力,并深入剖析其“认知”过程。为解决自主协作面临的难题,我们提出了一种名为角色扮演的新型通信智能体框架。该方法通过植入式提示(inception prompting)引导聊天智能体完成任务,同时确保与人类意图保持一致。我们展示了角色扮演如何用于生成对话数据,以研究智能体群体的行为与能力,为探索对话式语言模型提供了宝贵资源。原创 2026-06-18 10:30:00 · 31 阅读 · 0 评论 -
2025_NIPS_Cal-DETR: Calibrated Detection Transformer
该研究聚焦于基于Transformer的目标检测器(如Deformable-DETR、UP-DETR、DINO)的校准问题,核心解决深度神经网络(DNNs)在安全关键场景中常见的“过度自信预测”缺陷——即模型预测置信度与实际正确性不匹配的问题。现有校准方法多针对分类任务,且大多仅优化域内(in-domain)预测校准,对目标检测任务及域偏移(out-domain)场景的关注不足。为此,研究提出了Cal-DETR。原创 2026-06-18 09:30:00 · 26 阅读 · 0 评论 -
2025_NIPS_Importance Weighted Actor-Critic for Optimal Conservative Offline Reinforcement Learning
我们提出了A-Crab(基于平均贝尔曼误差正则化的演员-评论家算法),这是一种适用于数据覆盖不足的复杂环境下的新型实用离线强化学习(RL)算法。该算法将边际化重要性采样框架与演员-评论家范式相结合,其中评论家返回的演员(策略)评估相对于离线数据呈悲观态度,且具有较小的平均(重要性加权)贝尔曼误差。与现有方法相比,我们的算法同时具备多项优势:(1)即使结合一般函数逼近器,也能达到1N1/\sqrt{N}1/N的最优统计速率(N为离线数据集大小),收敛到离线数据中覆盖的最优策略;原创 2026-06-18 08:30:00 · 21 阅读 · 0 评论 -
2025_NIPS_The Goldilocks of Pragmatic Understanding: Fine-Tuning Strategy Matters for Implicature...
尽管大型语言模型(LLMs)已被广泛用作对话代理,但性能评估尚未涵盖沟通的关键环节:结合语用学在语境中解读语言。人类会利用对世界的信念和先验知识理解语言,例如,我们能直观地将“你留下指纹了吗?”这一问题的回应“我戴了手套”理解为“没有”。为探究LLMs是否具备这种隐含含义推理能力,我们设计了一项简单任务,并评估了四类广泛使用的最先进模型。研究发现,尽管仅评估需要二元推理(是/否)的表述,其中三类模型的表现仍接近随机水平。然而,经过示例级指令微调的LLMs表现显著更优。原创 2026-06-18 07:30:00 · 19 阅读 · 0 评论 -
2025_NIPS_Language Models are Weak Learners
机器学习理论与实践中的一个核心概念是弱学习器——即在任意给定数据分布上,性能略优于随机猜测(即使差距微小)的分类器。此类弱学习器是提升算法等经典机器学习方法的实践基础。本文提出,基于提示的大型语言模型(LLM)可有效充当上述弱学习器。具体而言,我们将LLM作为弱学习器应用于表格数据的提升算法中:通过提供(根据目标分布适当采样的)表格数据样本的文本描述,LLM能够生成样本总结,该总结可作为分类模板,实现弱学习器的核心目标。原创 2026-06-14 14:30:00 · 21 阅读 · 0 评论 -
2025_NIPS_Pairwise Causality Guided Transformers for Event Sequences
尽管成对因果关系在众多学科的观察性纵向分析中已得到广泛研究,但将因果对知识融入时间序列事件的深度学习模型仍处于探索阶段。本文提出一种新方法,通过注入成对定性因果知识(如“事件Z会增强未来事件Y的发生概率”),提升基于Transformer的多变量事件序列模型性能。我们建立了一套基于Transformer架构的时间序列事件因果推断新框架,为所提方法提供理论支撑,并证明了该方法能获得无偏估计。实验结果表明,通过有效利用因果对知识,该方法在预测准确率上优于多个最先进模型。原创 2026-06-17 10:30:00 · 124 阅读 · 0 评论 -
2025_NIPS_Fast Bellman Updates for Wasserstein Distributionally Robust MDPs
文章聚焦 Wasserstein 模糊集下的分布鲁棒马尔可夫决策过程(DRMDPs),针对传统解法计算复杂度高、难以适配大规模问题的痛点,提出了高效的 Bellman 更新求解框架。通过拆解分布鲁棒 Bellman 更新的优化问题,将其转化为可快速求解的子问题,最终在L1L_1L1L2L_2L2L∞L_\inftyL∞范数设定下,实现了准线性时间复杂度的求解,数值实验验证该方法优于现有主流算法。马尔可夫决策过程(MDPs)在模型模糊性下常面临敏感性问题。原创 2026-06-17 11:30:00 · 146 阅读 · 0 评论 -
2025_NIPS_SMACv2: An Improved Benchmark for Cooperative Multi-Agent Reinforcement Learning
该文指出经典协作式多智能体强化学习(MARL)基准测试SMAC存在随机性不足、部分可观测性无实际意义的缺陷,导致开环策略(仅依赖时间步)即可在多数场景中取得较好性能,无法有效评估复杂闭环策略。为此,作者提出改进基准SMACv2,通过程序化生成场景(随机团队构成、随机起始位置)提升随机性,引入扩展部分可观测性挑战(EPO)增强观测约束,并调整单位视野和攻击范围。实验表明,SMACv2能有效规避SMAC的缺陷,现有顶尖MARL算法在其上表现受限,可更好地推动下一代MARL方法的研发。原创 2026-06-17 09:30:00 · 159 阅读 · 0 评论 -
2025_NIPS_Learning World Models with Identifiable Factorization
在高维、嘈杂且非平稳的环境中,提取稳定且紧凑的环境表征对于高效强化学习至关重要。此类环境中存在不同类别的信息——如何有效提取和分离这些信息仍是一个具有挑战性的问题。本文提出IFactor,这是一个通用框架,用于建模四类不同的潜在状态变量,这些变量基于其与动作和奖励的交互关系,捕捉强化学习系统中的各类信息。我们的分析确立了这些潜在变量的块可识别性,这不仅提供了稳定且紧凑的表征,还揭示了所有与奖励相关的因素对策略学习都具有重要意义。原创 2026-06-17 07:30:00 · 22 阅读 · 0 评论 -
2025_NIPS_Budgeting Counterfactual for Offline RL
离线强化学习的核心挑战源于数据有限情况下,潜在动作领域内的一系列反事实推理困境:倘若我们选择了不同的行动方案会怎样?这些情况常常导致外推误差,而此类误差会随着问题时域的延长呈指数级累积。因此,至关重要的是要认识到,并非所有决策步骤对最终结果的重要性都相同,我们需要对策略所做出的反事实决策数量进行“预算管控”,以控制外推误差。与现有对策略或价值函数施加正则化的方法不同,我们提出了一种在训练过程中显式约束分布外动作数量的方法。原创 2026-06-17 08:30:00 · 23 阅读 · 0 评论 -
2025_NIPS_Mitigating Over-smoothing in Transformers via Regularized Nonlocal Functionals
该研究聚焦于Transformer模型中的过平滑(Over-smoothing)问题——即随着模型层数加深,token表示逐渐趋于一致,导致模型表征能力下降。文章通过建立非局部变分去噪框架,从理论上解释了过平滑的根源,并提出了一种新型Transformer模型NeuTRENO,有效缓解了这一问题。Transformer在自然语言处理和计算机视觉等广泛应用中取得了显著成功。然而,深层Transformer模型的表征能力会因过平滑问题而下降——当模型层数增加时,token表示会变得完全一致。原创 2026-06-17 12:30:00 · 27 阅读 · 0 评论 -
2025_NIPS_Structured State Space Models for In-Context Reinforcement Learning
结构化状态空间序列(S4)模型近年来在长程序列建模任务上取得了最先进的性能。这些模型还具有快速推理速度和可并行训练的特点,使其在许多强化学习场景中具有潜在的实用性。我们对S4的一个变体(S5)进行了修改,使其能够并行初始化和重置隐藏状态,从而能够处理强化学习任务。我们表明,我们的改进架构在序列长度方面的渐近运行速度快于Transformer,并且在简单的基于记忆的任务上表现优于RNN。我们在一组部分可观测环境上评估了改进后的架构,发现在实际应用中,我们的模型不仅性能优于RNN,运行速度还快了五倍以上。原创 2026-06-16 12:30:00 · 16 阅读 · 0 评论 -
2025_NIPS_ComSL: A Composite Speech-Language Model for End-to-End Speech-to-Text Translation
联合语音-语言训练极具挑战性,这不仅是因为其对训练数据和GPU资源的需求量巨大,还源于语音与语言之间存在的模态差异。本文提出了ComSL,这是一种基于现有预训练纯语音模型和纯语言模型构建的复合架构语音-语言模型,能够以数据高效的方式针对口语任务进行优化。具体而言,我们提出将跨模态学习融入迁移学习,并以多任务学习的形式在下游任务中同时进行这两项学习。原创 2026-06-16 10:30:00 · 306 阅读 · 0 评论 -
2025_NIPS_Uni3DETR: Unified 3D Detection Transformer
本文针对现有基于点云的3D目标检测模型多为室内或室外场景专用、缺乏统一架构的问题,提出了Uni3DETR——一种能同时适配室内和室外3D检测任务的统一Transformer架构。现有基于点云的3D检测模型均为特定场景(室内或室外)设计。由于不同环境下点云的目标分布和点密度存在显著差异,且3D评价指标复杂,目前仍缺乏能适配多样化场景的统一网络架构。本文提出Uni3DETR,一种在同一框架内同时处理室内和室外3D检测的统一模型。原创 2026-06-16 11:30:00 · 27 阅读 · 0 评论 -
2025_NIPS_Can Language Models Solve Graph Problems in Natural Language?
大型语言模型(LLMs)正日益被应用于各类含隐式图形结构的任务,例如机器人规划、多跳问答或知识探查、结构化常识推理等。尽管LLMs在这些含结构暗示的任务上取得了最先进的成果,但它们能否明确处理图和结构的文本描述、将其映射到接地概念空间并执行结构化操作,仍有待深入探索。为此,我们提出了NLGraph(自然语言图)——一个基于图的问题求解综合基准,完全以自然语言设计。NLGraph包含29,370个问题,覆盖8类图推理任务,复杂度各异:从连通性、最短路径等简单任务,到最大流、图神经网络模拟等复杂问题。原创 2026-06-12 14:30:00 · 19 阅读 · 0 评论 -
2025_NIPS_Tree of Thoughts: Deliberate Problem Solving with Large Language Models
语言模型正越来越多地被用于各类任务的通用问题解决,但在推理过程中仍受限于逐token、左到右的决策机制。这意味着它们在需要探索、策略性前瞻或初始决策起关键作用的任务中可能表现不佳。为克服这些挑战,我们提出了一种新的语言模型推理框架——“思维树”(Tree of Thoughts, ToT),该框架对流行的“思维链”(Chain of Thought)提示方法进行了泛化,允许在作为问题解决中间步骤的连贯文本单元(“思维”)上进行探索。原创 2026-06-13 14:30:00 · 37 阅读 · 0 评论
分享