- 博客(54)
- 资源 (2)
- 收藏
- 关注
原创 RL系列文章-PPO算法
链接:https://arxiv.org/pdf/1707.06347要理解GRPO以及后续的改进,必须先理解PPO算法。PPO算法也是继承自策划梯度的算法逻辑。
2026-06-21 22:58:36
186
原创 LLM综述-RL信用分配
强化学习(RL)已成为提升大语言模型(LLM)推理能力的核心技术,但其根本难题——信用分配(credit assignment)——在 LLM 时代以新的形式重现:模型生成一条长达数千 token 的推理链后,往往只在末尾获得一个稀疏的标量奖励(答案对/错),如何将这一最终成败的"信用"准确归因到链条中的每一个 token 或推理步骤,直接决定了训练的效率与上限。本综述系统梳理 2022–2026 年间该问题的 46 篇代表性工作,提出一个五维分类法:(1) 过程奖励模型(PRM);
2026-06-21 22:53:49
204
原创 LLM综述-信号竞争
推理时信号:system prompt、user prompt、few-shot examples、retrieved context、tool output 等,通过 attention / KV cache 在当前 forward pass 中被读取。参数内信号:预训练语料中的事实与文本分布、SFT 阶段写入的格式模板、RLHF / DPO / safety tuning 写入的偏好与拒答模式,通过模型权重在每次生成时稳定激活。当两者一致时,问题不可见。
2026-06-21 22:52:15
234
原创 LLM综述系列-OPD
核心病灶:exposure bias(暴露偏差)。传统 off-policy 蒸馏(SFT-on-teacher)让学生在完美的教师前缀上训练,推理时却要生成自己的前缀。小错误累积成学生很少被训练去恢复的轨迹,且这种暴露偏差被证明随序列长度近似平方增长——任务越长、越需推理,问题越严重。OPD 的改造:让教师对学生实际产出的内容给反馈(学生自采样轨迹 + 教师 token 级稠密监督),把蒸馏从"单次模仿"重组为"迭代纠错",目标是把误差累积从平方降到线性。
2026-06-21 22:50:30
301
原创 LLM综述系列-RL难样本学习
摘要 本文系统综述了大语言模型(LLM)强化学习中的难样本学习问题。研究发现,在主流GRPO框架下,全对或全错的训练样本会产生零梯度,导致训练效率低下。文章提出五维分类法,梳理56篇代表性工作:(1)样本过滤与动态采样;(2)课程学习与难度递进;(3)难度感知数据选择;(4)工业实践;(5)富反馈与蒸馏技术。分析揭示了领域存在的六大方法论问题,包括理论重复性、难度漂移、过滤与保留的路线争议等,并着重讨论了两大未解难题:中等难度最优理论与难样本权重分配的冲突,以及过滤与保留难样本的选择标准。文章最后提出未来研
2026-06-21 22:47:44
397
原创 【JDBC连接openGauss报错】 ERROR: relation “XXX“ does not exist on dn_6001
【JDBC连接opengauss报错】
2023-06-11 09:46:34
6490
1
原创 【机试算法学习】(一) 排序与进位制 1.成绩排序
【机试算法学习】(一) 排序与进位制 1.成绩排序主要涉及稳定排序相关的问题:什么是稳定排序、如何调用C++的稳定排序、如何定义比较函数等。
2023-04-01 13:05:32
270
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅