LLM Training
文章平均质量分 79
主要是LLM训练相关的paper,针对训练加速,微调等相关内容。涉及的关键词包括finetuning以及training。
UnknownBody
AI博士,最近一直follow大模型相关论文,每日会更新学术界论文的进展。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models
优化大型语言模型(LLMs)有监督微调(SFT)的数据混合比例,对开发通用模型至关重要,但该领域的研究仍有待深入。本文将数据混合问题构建为优化问题,提出一种旨在最小化验证损失的新方法。我们的方法通过对“迁移有效数据”建模,并利用微调缩放定律,实现对损失的参数化。通过在各类小规模数据混合场景下进行实验,我们拟合出相关参数并推导得到最优领域权重。本文提供的数学证明与实证结果均表明,该算法在所有领域的整体性能和单项性能上均表现优异。原创 2026-08-18 14:30:00 · 10 阅读 · 0 评论 -
FastContext: Training Efficient Repository Explorer for Coding Agents
大语言模型(LLM)驱动的代码智能体在各类软件工程任务中已取得亮眼效果,但代码仓库探索环节仍是核心瓶颈:定位目标代码会消耗海量token,且大量无关代码片段会污染智能体上下文。现有绝大多数代码智能体采用单一模型同时完成仓库检索与问题求解,所有检索读取、搜索的中间过程都会残留在求解智能体的对话历史中。本文提出FastContext——一款专用探索子智能体,将仓库检索与任务求解彻底解耦。主智能体可按需调用FastContext,该子智能体并行执行多工具调用,仅输出精简的文件路径与代码行区间作为聚焦上下文。原创 2026-08-15 09:30:00 · 12 阅读 · 0 评论 -
Supervised Fine Tuning of Large Language Models for Domain Specific Knowledge Graph Construction:...
大语言模型与知识图谱在历史文化领域具有广阔的应用潜力,有助于文化遗产的挖掘、研究与理解。本文以近代湖湘文化孕育的湖南历史名人为案例,预训练大模型可协助研究者从文献中快速提取特定历史人物信息(包括基本详情、生平事件及社会关系)并构建结构化知识图谱,为相关研究提供支持。目前,湖南历史名人的系统性数据收集仍较为匮乏,且通用大语言模型在这类低资源场景中往往存在领域知识提取精度不足、结构化输出能力薄弱等问题。为此,本文提出一种面向领域特定大模型的有监督微调方法,以提升湖南历史名人信息提取的质量与效率。原创 2026-08-13 08:30:00 · 127 阅读 · 0 评论 -
RoSA: Enhancing Parameter-Efficient Fine-Tuning via RoPE-aware Selective Adaptation in Large Lang...
微调大型语言模型对于特定任务适配至关重要,但计算成本仍高得令人却步。参数高效微调(PEFT)方法已成为一种解决方案,但现有方法通常忽视模型组件的独特作用以及层间的异质性重要性,从而限制了适配效率。基于旋转位置编码(RoPE)会在注意力状态的低频维度诱导关键激活这一观察,我们提出了RoPE感知选择性适配(RoSA)——一种新型PEFT框架,能够以更具针对性和有效性的方式分配可训练参数。原创 2026-08-11 08:30:00 · 13 阅读 · 0 评论 -
STABLE: Gated Continual Learning for Large Language Models
该研究针对大型语言模型(LLMs)持续学习中存在的灾难性遗忘问题(即新增知识更新会破坏已有知识),提出了名为STABLE的门控持续自编辑框架。核心思路是基于低秩适配(LoRA)的参数高效微调(PEFT),通过门控机制约束模型更新,在保留适配能力的同时避免遗忘。核心问题:LLMs部署后需增量更新(如融入新事实、领域术语),但无约束的顺序更新会导致灾难性遗忘,降低模型可靠性。框架设计每个LoRA编辑候选需通过门控评估,门控基于用户选择的三种指标之一与预设预算对比;原创 2026-06-22 08:30:00 · 350 阅读 · 0 评论 -
2025_NIPS_Memory-Efficient Fine-Tuning of Compressed Large Language Models via sub-4-bit Integer ...
大型语言模型(LLMs)由于其高内存需求和计算成本,在微调和部署方面面临挑战。尽管参数高效微调(PEFT)方法旨在降低微调过程中优化器状态的内存占用,但预训练LLM权重的固有规模仍是一个迫切需要解决的问题。虽然量化技术被广泛提出以缓解内存需求并加速LLM推理,但这些技术大多面向部署阶段。为填补这一空白,本文提出了参数高效且量化感知适配(PEQA)——一种简单而有效的方法,它结合了PEFT与量化LLM的优势。通过仅更新量化尺度,PEQA可直接应用于量化LLM,确保无缝的任务切换。原创 2026-06-16 13:30:00 · 20 阅读 · 0 评论 -
2025_NIPS_Fine-Tuning Language Models with Just Forward Passes
微调语言模型(LM)已在各类下游任务中取得成功,但随着模型规模扩大,反向传播所需的内存量变得难以承受。零阶(ZO)方法原则上仅需两次前向传播即可估计梯度,但理论上优化大型模型时速度会极慢。本文提出一种内存高效的零阶优化器(MeZO),对经典ZO-SGD方法进行适配以实现原地运算,从而在与推理相同的内存占用下微调语言模型。例如,使用单块A100 80GB GPU时,MeZO可训练300亿参数模型,而反向传播微调在相同硬件条件下仅能训练27亿参数模型。原创 2026-06-12 09:30:00 · 23 阅读 · 0 评论 -
Fine-tuning of Large Language Models for Constituency Parsing Using a Sequence to Sequence Approach
大型神经模型在自然语言处理领域的最新进展,为探索基于机器学习的短语结构分析新句法方法提供了可能。本文提出通过序列到序列翻译的方式微调大型语言模型以实现短语结构分析——将输入序列(待分析句子)转化为输出序列(其短语结构分析结果)。该技术的最终目标是扩展MiSintaxis工具的功能,该工具专为西班牙语语法教学设计。研究人员在基于AnCora-ES语料库生成的训练数据上,对Hugging Face平台可用的模型进行了微调,并使用F₁指标对比了实验结果。原创 2026-06-11 13:30:00 · 21 阅读 · 0 评论 -
2025_NIPS_Distributed Inference and Fine-tuning of Large Language Models Over The Internet
大语言模型(LLMs)在众多自然语言处理任务中极具实用价值,且规模越大性能越优——目前最优的开源模型已具备超过500亿参数。然而,使用这些500亿参数以上的模型需要高端硬件,这使得大多数研究者难以获取。本文研究了大模型的低成本推理与微调方法,对比了本地策略与分布式策略。我们发现,足够大的模型(500亿参数以上)即使在消费级网络中的地理分布式设备上也能高效运行。这一发现意味着,通过整合多个研究团队和志愿者的闲置计算资源,有望实现大模型的高效部署。原创 2026-06-10 11:30:00 · 26 阅读 · 0 评论 -
2025_NIPS_WalkLM: A Uniform Language Model Fine-tuning Framework for Attributed Graph Embedding
图被广泛用于建模互联实体,并在各类真实世界应用中提升下游预测性能。然而,如今的真实世界图通常包含多种类型节点甚至边的复杂属性,难以进行统一建模;而广泛使用的图神经网络(GNNs)往往需要针对特定下游预测任务进行充分训练才能达到良好性能。本文采用与 GNNs 截然不同的思路,旨在同时实现对真实世界图复杂属性与灵活结构的深度联合建模,并获取不受特定下游预测限制的无监督通用图表示。我们的框架基于语言模型(LMs)与随机游走(RWs)的自然融合,简洁、高效且数据利用率高。原创 2026-06-08 11:30:00 · 305 阅读 · 0 评论 -
2025_NIPS_No Train No Gain: Revisiting Efficient Training Algorithms For Transformer-based Langua...
近年来,训练基于Transformer的语言模型所需的计算量急剧增加。这一趋势推动了高效训练算法的研究,这类算法旨在比标准训练更快地提升训练、验证和下游任务性能。本文重新审视了三类此类算法:动态架构(层堆叠、层丢弃)、批量选择(选择性反向传播、RHO损失)和高效优化器(Lion、Sophia)。在使用这些方法对BERT和T5进行固定计算预算的预训练时,我们发现与采用全衰减学习率的基线模型相比,它们在训练、验证和下游任务上的增益均消失了。原创 2026-05-18 11:30:00 · 27 阅读 · 0 评论 -
2025_NIPS_ACCO: Accumulate While You Communicate for Communication-Overlapped Sharded LLM Training
训练大规模语言模型(LLM)依赖于分布式实现,需使用多块GPU与分片优化器并行计算梯度。然而,数据并行设置中的梯度同步会产生随工作节点数量增加而增长的通信开销,限制了并行效率。局部优化算法虽能减少通信,但会因阻碍优化器状态分片而导致高昂的内存成本,影响可扩展性。为解决这一问题,我们提出了ACCO(Accumulate While You Communicate)——一种面向分布式LLM训练的内存高效优化算法。通过在计算新梯度的同时同步延迟梯度,ACCO减少了GPU空闲时间并支持异构硬件。原创 2026-05-07 09:30:00 · 28 阅读 · 0 评论 -
2025_NIPS_Fixing It in Post: A Comparative Study of LLM Post-Training Data Quality and Model Perf...
近年来,大语言模型(LLM)相关研究日益关注训练后过程及与数据集的对齐——这些数据集经精心筛选,旨在提升模型的指令遵循能力、世界知识储备和专业技能。然而,主流开源和闭源LLM所使用的大多数训练后数据集仍未向公众开放,其构建过程的相关信息也较为有限。这种透明度的缺失推动了近期开源训练后语料库的发展。尽管在这些开源替代数据集上训练可使模型性能接近主流模型,但由于大规模严格对比所需的计算成本极高,系统性比较仍面临挑战,相关研究也因此相对匮乏。原创 2026-05-06 10:30:00 · 134 阅读 · 0 评论 -
2025_NIPS_Mechanism Design for LLM Fine-tuning with Multiple Reward Models
大语言模型(LLM)微调以聚合多种偏好已引起广泛研究关注。随着聚合算法的发展,一种潜在的经济场景应运而生:向具有不同偏好的主体提供微调服务。在这种情况下,主体可能从策略性误报其偏好中获益,但这会损害聚合性能。本文通过将该问题构建为机制设计问题来解决此类激励问题:LLM提供者为主体确定微调目标(训练规则)和定价方案(支付规则)。我们主要关注在特定正则化约束下最大化社会福利的训练规则,称为SW-Max规则。首先,我们证明在大多数情况下,仅使用SW-Max规则时如实报告并非最优,因此凸显了支付规则的必要性。原创 2026-04-29 08:30:00 · 118 阅读 · 0 评论 -
2025_NIPS_Loquetier: A Virtualized Multi-LoRA Framework for Unified LLM Fine-tuning and Serving
低秩适配(LoRA)已成为广泛采用的参数高效微调(PEFT)技术,用于将大语言模型(LLMs)适配到下游任务。尽管已有研究探索了LLM训练与服务的融合策略,但在统一基于LoRA模型的微调与推理方面仍存在缺口。本文提出Loquetier,一款虚拟化多LoRA框架,在单一运行时中无缝集成LoRA微调与服务。Loquetier包含两大核心组件:(1)虚拟化模块,隔离PEFT相关修改并支持在共享基础模型上部署多个适配器;(2)优化计算流与内核设计,在向前传播中融合微调与推理路径,实现高效批处理并最小化内核调用开销。原创 2026-04-27 12:30:00 · 120 阅读 · 0 评论 -
2025_NIPS_Steering Information Utility in Key-Value Memory for Language Model Post-Training
语言模型(LM)的最新进展标志着后训练的重要性日益凸显。然而,监督微调(SFT)等后训练方法无法保证模型有效利用预训练阶段习得的知识。为此,我们提出一种轻量级方法InfoSteer,旨在后训练阶段促进语言模型对参数化信息的利用。具体而言,InfoSteer将前馈网络(FFN)层视为关联键值记忆系统,并通过前向传播干预或反向传播过程中的正则化,推动模型调用存储的记忆向量。原创 2026-04-27 11:30:00 · 31 阅读 · 0 评论 -
2025_NIPS_Data Efficient Adaptation in Large Language Models via Continuous Low-Rank Fine-Tuning
大型语言模型(LLMs)的最新进展凸显了微调(FT)技术在使模型适配特定任务中的关键作用,尤其是在从头重新训练计算成本过高的场景下。微调允许LLMs利用任务或领域特定数据,生成更能满足目标应用需求的模型。然而,传统微调方法常面临灾难性遗忘和数据效率低下的问题,限制了其实际应用价值。为解决这些挑战,本文提出DEAL框架——一种将低秩适配(LoRA)与持续微调策略相结合的新型方案。该框架通过整合知识保留模块和自适应参数更新模块,在保持效率的同时克服了现有微调方法的局限性。原创 2026-04-23 10:30:00 · 33 阅读 · 0 评论 -
2025_NIPS_Analyzing Similarity Metrics for Data Selection for Language Model Pretraining
衡量训练样本间的相似度对于构建高质量、多样化的语言模型预训练数据集至关重要。然而,相似度通常通过通用的现成嵌入模型计算,这类模型是为检索等任务训练的。这些基于嵌入的相似度度量是否适用于预训练数据筛选,在很大程度上仍未得到探索。本文提出一种新框架,专门评估相似度度量在语言模型预训练数据筛选场景中的适配性。该框架的首个评估准则旨在捕捉嵌入空间中的距离如何反映不同训练样本在预训练损失上的泛化性;原创 2026-04-08 07:30:00 · 122 阅读 · 0 评论 -
2025_NIPS_Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning
大型语言模型通常通过在领域特定数据上进行监督微调,以适配下游任务。标准微调的核心是最小化生成损失来优化模型参数,而本文更进一步——借鉴人类学习者通过反思过往错误提升未来表现的方式,保留并利用模型自身的学习信号。我们首先提出“错误日志(Mistake Log)”概念,用于系统跟踪模型在整个微调过程中的学习行为与反复出现的错误。原创 2026-04-04 08:30:00 · 167 阅读 · 0 评论 -
2025_NIPS_URLs Help, Topics Guide: Understanding Metadata Utility in LLM Training
大语言模型(LLMs)通常在海量文本语料上进行预训练,却未利用来源、质量或主题等上下文元数据,形成了无上下文的学习范式。尽管近期研究表明,将URL等元数据作为上下文(即不参与损失计算的辅助输入)可提升训练效率和下游任务性能,但对于哪些类型的元数据真正有效以及在何种条件下有效,相关理解仍较为有限。本研究通过系统性评估发现,并非所有元数据类型的贡献都是均等的:仅URL上下文能加速训练,而质量分数和主题/格式领域信息未带来明显收益。原创 2026-03-30 10:30:00 · 38 阅读 · 0 评论 -
2025_NIPS_Harmony in Divergence: Towards Fast, Accurate, and Memory-efficient Zeroth-order LLM Fine-
大语言模型(LLMs)在各类任务中表现出色,但标准的一阶(FO)微调需要大量内存,严重限制了实际部署。近年来,零阶(ZO)优化作为一种极具潜力的内存高效训练范式脱颖而出,它无需反向传播,仅依靠正向传播进行梯度估计,在资源受限场景中极具吸引力。然而,ZO方法在收敛速度和精度上均远落后于FO方法。为填补这一差距,我们提出了一种新颖的层间分歧分析方法,揭示了FO和ZO优化的独特更新模式。基于分析结果,我们旨在逼近FO方法的学习能力,提出了分歧驱动零阶优化(DiZO)。原创 2026-03-19 14:30:00 · 34 阅读 · 0 评论 -
2025_NIPS_Activated LoRA: Fine-tuned LLMs for Intrinsics
低秩适配(LoRA)已成为微调大型基础模型权重的高效框架,并已成为基于数据定制大语言模型(LLMs)的首选方法。尽管LoRA有望实现高度定制化的行为和能力,但在多轮对话场景中切换相关LoRA时效率低下——因为在生成开始前,必须使用LoRA权重重新计算整个对话历史的键值(KV)缓存。为解决这一问题,我们提出了激活式LoRA(aLoRA),这是一种适配器架构,对LoRA框架进行修改,仅对aLoRA激活后的序列中的令牌适配权重。原创 2026-03-19 12:30:00 · 50 阅读 · 0 评论 -
The Appeal and Reality of Recycling LoRAs with Adaptive Merging
本文聚焦于LoRA(低秩适配)模块的回收与自适应合并技术,核心研究如何利用公开模型仓库中用户贡献的“真实场景”LoRA模块提升下游任务性能。自适应合并的有限优势:自适应合并方法虽能优于基础模型,但与直接在目标任务数据上训练新LoRA相比,未展现出显著且稳定的性能提升。LoRA选择的无关性:当合并池包含目标任务LoRA时,随机选择LoRA与基于参数相似度、任务性能的精细化选择策略效果相当;甚至随机初始化参数的LoRA也能达到类似性能,说明其优势可能源于正则化效应而非跨任务知识迁移。正迁移的条件限制。原创 2026-03-13 11:30:00 · 36 阅读 · 0 评论 -
2025_NIPS_S’MoRE: Structural Mixture of Residual Experts for Parameter-Efficient LLM Fine-tuning
微调预训练大型语言模型(LLMs)面临着平衡参数效率与模型容量的双重挑战。现有方法(如低秩适配LoRA)虽高效但缺乏灵活性,而混合专家模型(MoE)虽能提升模型容量,却需付出更多参数且存在利用率不足的问题。为解决这些局限,我们提出结构残差混合专家框架(S’MoRE),该框架无缝融合了LoRA的效率与MoE的灵活性。从概念上讲,S’MoRE对专家权重进行层级低秩分解,生成不同阶数的残差,并以多层结构互联。通过让输入token在残差子树中传播,S’MoRE仅需实例化和组合少量低秩矩阵,即可模拟大量专家的容量。原创 2026-02-28 10:30:00 · 53 阅读 · 0 评论 -
2025_NIPS_Power Lines: Scaling Laws for Weight Decay and Batch Size in LLM Pre-training
高效的大型语言模型(LLM)预训练需要精心调优的超参数(HP),包括学习率η和权重衰减λ。本文研究超参数的缩放规律:即当模型规模N、数据集规模D和批量大小B变化时,超参数的调整公式。近期研究[1]表明,AdamW时间尺度τ=B/(ηλD)应在不同训练配置中保持恒定,我们验证了在固定N和D时,最优λ随B线性缩放的推论。然而,当N和D缩放时,我们发现最优τ遵循令牌-参数比(D/N)的精确幂律。该规律为大规模训练前准确预测最优λ(λ_opt)提供了方法。原创 2026-02-18 09:30:00 · 54 阅读 · 0 评论 -
2025_NIPS_Drag-and-Drop LLMs: Zero-Shot Prompt-to-Weights
现代参数高效微调(PEFT)方法(如低秩适配LoRA)降低了大语言模型(LLMs)的定制成本,但仍需为每个下游数据集单独执行优化过程。本文提出Drag-and-Drop LLMs(DnD)——一种基于提示条件的参数生成器,通过将少量无标签任务提示直接映射为LoRA权重更新,消除了逐任务训练的需求。轻量级文本编码器将每个提示批次提炼为条件嵌入,随后通过级联超卷积解码器转化为完整的LoRA矩阵集合。原创 2026-02-12 13:30:00 · 44 阅读 · 0 评论 -
2025_NIPS_Learning and Planning Multi-Agent Tasks via an MoE-based World Model
本文针对多任务多智能体强化学习(MT-MARL)中不同任务最优策略差异大、模型泛化难的问题,提出了基于混合专家(MoE)架构的世界模型方法M3W。核心发现是多任务动力学存在“有界相似性”——同类任务(如开门/关门)动力学高度相似,异类任务(如开门/接球)差异显著。M3W将模块化设计应用于世界模型而非策略网络,通过SoftMoE动力学模型和SparseMoE奖励预测器,实现相似任务知识复用与异类任务梯度冲突隔离,再结合模型预测路径积分(MPPI)规划器直接基于预测轨迹优化动作,无需依赖显式策略。原创 2026-02-11 15:30:00 · 59 阅读 · 0 评论 -
2025_NIPS_FP4 All the Way: Fully Quantized Training of LLMs
我们首次展示了大型语言模型(LLMs)的全量化训练(FQT),在高达1万亿token的数据集上,权重、激活值和梯度主要采用4位浮点数(FP4)精度。我们深入研究了FP4的关键设计选择,包括块大小、缩放格式和舍入方式。分析表明,NVFP4格式(每个包含16个FP4值的块(E2M1)共享一个以E4M3格式表示的缩放因子)能提供最优结果。我们在反向传播和更新过程中使用随机舍入,在前向传播中使用就近舍入,以提升训练稳定性。原创 2026-01-31 13:30:00 · 251 阅读 · 0 评论 -
2025_NIPS_FlowerTune: A Cross-Domain Benchmark for Federated Fine-Tuning of Large Language Models
大型语言模型(LLMs)已在多个领域取得最先进成果,但其发展仍依赖海量公开数据,引发了数据稀缺以及难以获取领域特定敏感信息的担忧。联邦学习(FL)通过在不共享原始数据的前提下对预训练LLMs进行去中心化微调,为解决这些挑战提供了极具吸引力的框架。然而,预训练LLMs在联邦学习环境中的兼容性和性能仍未得到充分探索。原创 2026-01-31 08:30:00 · 87 阅读 · 0 评论 -
Self-Adapting Language Models
本文提出了自适应性大型语言模型(Self-Adapting LLMs, SEAL)框架,旨在解决传统大型语言模型(LLMs)静态化的问题——即无法根据新任务、知识或示例动态调整权重。SEAL的核心思想是让LLM通过生成“自我编辑(self-edits)”来实现自我适应,这些自我编辑是模型生成的自然语言指令,用于指定微调数据、优化超参数或调用工具进行数据增强,最终通过监督微调(SFT)实现模型权重的持续更新。大型语言模型(LLMs)功能强大但具有静态性,它们缺乏根据新任务、知识或示例调整自身权重的机制。原创 2026-01-30 10:30:00 · 78 阅读 · 0 评论 -
2025_NIPS_Gradient Multi-Normalization for Efficient LLM Training
该研究针对大型语言模型(LLM)训练中“自适应优化器(如Adam)内存开销大、简单一阶方法(如SGD)性能不足”的矛盾,提出了梯度多归一化(gradient multi-normalization)框架,据此设计了轻量级无状态优化器SinkGD。SinkGD通过交替进行行和列的欧几里得归一化,在保持SGD级内存占用的同时,降低了计算复杂度(仅需O(nm)操作),在LLaMA模型预训练中实现了比Adam更快的收敛(最高3倍有效吞吐量)和更优的困惑度,且内存需求仅为Adam的40%左右。原创 2026-01-24 12:30:00 · 50 阅读 · 0 评论 -
2025_NIPS_Backdoor Cleaning without External Guidance in MLLM Fine-tuning
多模态大型语言模型(MLLMs)正日益广泛应用于“微调即服务(FTaaS)”场景,用户提交的数据集可将通用模型适配至下游任务。然而,这种灵活性带来了严重的安全风险——恶意微调只需极小代价即可向MLLMs植入后门。本文观察到,后门触发器会系统性破坏跨模态处理,导致模型注意力异常集中于非语义区域,我们将此现象称为“注意力坍缩”。基于这一发现,我们提出Believe Your Eyes(BYE)数据过滤框架,利用注意力熵模式作为自监督信号识别并过滤后门样本。原创 2026-01-23 13:30:00 · 43 阅读 · 0 评论 -
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
随着语言模型的能力日益增强,用户期望它们不仅能提供准确的响应,还能在各种场景下展现出与多样化人类偏好对齐的行为。为实现这一目标,强化学习(RL)流程已开始整合多个奖励信号,每个奖励对应一种特定偏好,以引导模型朝向这些期望行为优化。然而,近期研究在多奖励场景下默认采用组相对策略优化(GRPO),却未验证其适用性。本文表明,直接应用GRPO对不同的滚动条奖励组合进行归一化,会导致这些组合坍缩为相同的优势值,降低训练信号的分辨率,进而造成次优收敛,部分情况下还会引发早期训练失败。原创 2026-01-26 10:30:00 · 71 阅读 · 0 评论 -
2025_NIPS_Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
该研究聚焦于大型语言模型(LLMs)监督微调(SFT)中普遍存在的“灾难性遗忘”问题——即模型在适配特定领域任务时,会显著退化已有的通用能力。通过对比SFT与在线强化学习(on-policy RL)的学习机制,研究发现两者存在核心的数据分布差异:RL的训练数据源于模型自身生成,与模型内部信念一致,仅包含高概率置信区或高熵探索区的token;原创 2026-01-26 08:30:00 · 174 阅读 · 0 评论 -
2025_NIPS_Optimization Inspired Few-Shot Adaptation for Large Language Models
大语言模型(LLMs)在实际应用中展现出卓越性能,但通过微调使LLMs适配新任务通常需要大量训练数据和计算资源,这在少样本场景下并不现实。现有方法(如上下文学习和参数高效微调)存在关键局限:上下文学习会引入额外的推理计算开销,且性能提升有限;而参数高效微调模型在少量演示样本上容易过拟合。在本研究中,我们将LLMs的前向传播重新解读为一个优化过程——一系列预条件梯度下降步骤,用于优化内部表示。原创 2026-01-22 09:30:00 · 144 阅读 · 0 评论 -
2025_NIPS_C-LoRA: Contextual Low-Rank Adaptation for Uncertainty Estimation in Large Language Models
低秩适配(LoRA)为大语言模型(LLM)微调提供了经济高效的解决方案,但在数据稀缺的少样本场景下,它往往会产生过度自信的预测。为解决这一问题,多项经典统计学习方法已被重新用于可扩展的不确定性感知LoRA微调。然而,这些方法忽略了输入特性对预测不确定性估计的影响。为弥补这一局限,我们提出上下文低秩适配(C-LoRA),一种新颖的不确定性感知且参数高效的微调方法。该方法通过开发新的轻量级LoRA模块,将其与每个输入数据样本进行上下文关联,以动态调整不确定性估计。原创 2026-01-14 14:30:00 · 54 阅读 · 0 评论 -
2024_ICLR-Never Train from Scratch: FAIR COMPARISON OF LONGSEQUENCE MODELS REQUIRES DATA-DRIVEN PRIO
在机器学习领域,建模序列中的长程依赖关系是一项长期目标,这催生出诸如状态空间模型等架构,它们在长序列任务上的性能显著优于Transformer。然而,这些令人印象深刻的实证增益大多是在基准测试(如Long Range Arena)中验证的——在这些基准中,模型采用随机初始化,通过输入序列预测目标标签进行训练。本文中,我们发现随机初始化会严重高估不同架构间的性能差异;原创 2026-01-04 08:30:00 · 62 阅读 · 0 评论 -
Memory Retrieval and Consolidation in Large Language Models through Function Tokens
LLMs虽能通过预训练巩固知识、推理时检索知识,但记忆检索与巩固的机制尚不明确。研究受语言学中“功能词”概念启发,将LLM的令牌分为函数令牌(高频,如标点、介词、冠词)和内容令牌(低频,如名词、动词),探究二者在记忆机制中的作用。大型语言模型(LLMs)的显著成功,源于其能在预训练阶段将海量知识巩固到记忆中,并在推理阶段从记忆中检索知识——这一能力使其具备知识记忆、指令遵循和推理等高级功能。然而,LLMs中记忆检索与巩固的机制仍未被充分理解。原创 2025-11-24 14:59:16 · 92 阅读 · 0 评论 -
AILoRA: Function-Aware Asymmetric Initialization for Low-Rank Adaptation of Large Language Models
参数高效微调(PEFT)旨在降低将大规模预训练模型适配到各类下游任务时产生的巨大计算和内存开销。在众多PEFT策略中,低秩适配(LoRA)因其出色的实证性能和较低的实现复杂度,已成为应用最广泛的方法之一。在实际部署中,LoRA通常应用于自注意力模块的WQW^QWQ(查询投影矩阵)和WVW^VWV(价值投影矩阵),从而在模型性能与参数效率之间实现高效平衡。尽管LoRA在实证方面取得了显著成功,但仍面临性能欠佳、收敛速度慢等挑战。原创 2025-11-30 08:30:00 · 177 阅读 · 0 评论 -
RECYCLING PRETRAINED CHECKPOINTS: ORTHOGONAL GROWTH OF MIXTURE-OF-EXPERTS FOR EFFICIENT LARGE LANGUA
预训练大型语言模型(LLM)的计算成本正快速增长,因此亟需更高效的训练方法。现有训练成熟的模型 checkpoint 已投入大量计算资源,但由于工程限制或模型容量不足,其中许多资源仍未被充分利用。为高效复用这些“沉没成本”,我们提出通过扩展模型参数数量并延续训练的方式,实现预训练 checkpoint 的“回收”。我们针对收敛后的混合专家(MoE)模型,设计了一种正交增长方法:用于深度扩展的插入式层复制,以及用于宽度扩展的带噪声注入专家复制。原创 2025-11-29 09:30:00 · 198 阅读 · 0 评论
分享