- 博客(101)
- 收藏
- 关注
原创 【清华代码熊】GLM/Qwen/Kimi/DeepSeek 基座模型架构对比
📌 本期对比解析 GLM-5.3-Flash / Kimi K3 / DeepSeek V4 / Qwen3.8-Flash-Next 开源基座架构。
2026-09-11 09:54:56
35
原创 【清华代码熊】VLM 使用的 2x2 PatchMerger 代码/原理解析
📌 最近发布的 GLM-5.3-Flash / Kimi-K3 / Qwen-3.8 等多模态模型仍然是遵循 VE-Projector-LLM 的三段式架构,Projector 架构都是来源于 Qwen 早期的 Patch Merger 进行 2x2 图像降采样,本期解析 Patch Merger 降采样原理。
2026-09-09 13:10:39
109
原创 【清华代码熊】多模态Qwen-3.8-Flash-Next视觉编码器解析
📌 本期继续拆解 Qwen-3.8-Flash-Next 模型架构,关注多模态视觉编码器(VE)部分架构设计。
2026-09-07 11:28:35
191
原创 【清华代码熊】Qwen3.8-Flash-Next 模型架构 & 代码解析
📌 本期解析Qwen3.8-Flash-Next 模型架构(Qwen-4 架构前瞻版本),可以对照 GLM-5.3-Flash 架构理解。 📌 包含知识点:🌟 GDN 混合注意力架构🌟 QSA(Qwen Sparse Attention)/ 蒸馏训练 CPT🌟 GR(Gated Residual)🌟 N-gram 嵌入层
2026-09-05 10:09:47
240
原创 【清华代码熊】GLM-5.3-Flash 架构解析:KDA + IndexPool
📌 本期解析 GLM-5.3-Flash 架构,包含知识点:🌟 KDA 线性注意力(Kimi Delta Attention)🌟 DSA + IndexPool(K-Pool 压缩索引器)🌟 NoPE MLA:语言主干舍弃 RoPE🌟 mHC(Manifold-Constrained Hyper-Connections)
2026-09-01 08:11:40
221
原创 【清华代码熊】On-Policy Distillation(OPD)系列文章总结
📌 本期总结一下最近的 On-Policy Distillation(OPD)解析文章:🌟 OPD 基础概念🌟 OPD 的两种变体 / 拓展🌟 OPD 的拓展形式 / 关键问题🌟 Qwen/Kimi/GLM/DeepSeek/MiMo 等基座的 OPD 实践路线
2026-08-27 23:37:37
232
原创 【清华代码熊】Qwen/GLM/DeepSeek基座MoE路由回放策略对比
📌 上期介绍了 MoE 模型 RL 过程中的 R2/R3 路由回放策略,本期总结Qwen/GLM/DeepSeek/MiMo等基座中使用的路由回放策略、以及后续的改进。
2026-08-26 21:10:24
145
原创 【清华代码熊】面试官:大模型 RL 训推不一致原因?解决方案
📌 今天解析面试题:大模型 RL 训推不一致原因?解决方案有哪些?可以结合上期 R2/R3 路由回放一起看。
2026-08-24 21:05:23
224
原创 【清华代码熊】面试官:MoE 模型的 RL 为什么需要路由回放?
📌 本期解析面试题:MoE 模型的 RL 为什么需要路由回放?路由回放的 R2 / R3 策略的原理和区别?
2026-08-21 22:08:46
38
原创 【清华代码熊】verl 框架Critic-free RL算法脉络梳理/解析
📌 本期解析 verl 中的 critic-free RL 算法发展脉络:ReMax、RLOO、GRPO、REINFORCE++。
2026-08-20 08:36:06
162
原创 【清华代码熊】小红书dots3-note Preview架构/TEMPO解析
📌 最近小红书发布并且开源了 dots3-note Preview 模型,本期结合技术博客《dots3-note Preview: A Small but Mighty Step Toward Long-Horizon Agency in Real Life》和代码解析 dots3-note Preview 的模型架构 / 以及长程 Agentic 任务后训练算法 TEMPO:Test-Time-Scaled Value Estimation with Macro-Step Policy Optimiza
2026-08-17 20:59:18
203
原创 【清华代码熊】解析|GLM 5.3 后训练技术博客
📌 本期深度解析 GLM 5.3 官方技术博客《GLM-5.3: Frontier Coding with Emergent Cyber Capabilities》 📌 GLM-5.3 在 GLM-5.2 的上基座主要进行了后训练拓展:环境拓展、任务多样性拓展、算力拓展:在模型架构、基础设施上,GLM-5.3 继承了 GLM-5.2 已经搭建好的长程任务环境 stack。RL Scaling 的难点从模型转移到环境,GLM-5.3 在环境/任务合成上用 pipeline 端到端合成环境,部分任务
2026-08-16 00:13:06
185
原创 【清华代码熊】Top-K On-Policy Distillation选择KL散度?
📌 本期解析 On-Policy Distillation(OPD)中 Top-K OPD 的实现:为了降低全词表的通信/显存影响,在 Top-K 支撑集上优化 KL 而非全词表 KL,本期详细解析原理/如何配置?
2026-08-13 21:27:08
205
原创 【清华代码熊】Agent Harness 工程实践之(4):Agent Loop
📌 Agent Harness 是 2026 年上半年 Agent 技术代名词,这个系列会系统讲解 Agent Harness 在各个维度的做法。 🔥 这个系列会通过解析 Claude Code / DeepAgents / OpenHands 等框架,通过“了解Harness 工业做法” 学习 Harness。
2026-08-12 21:29:14
42
原创 【清华代码熊】解析 Kimi K3 Multi-Token Prediction(MTP)
📌 本期解析 Kimi K3 的推理优化 Multi-Token Prediction(MTP)算法设计/实现策略。 📌 Speculative Decoding(投机解码/推测解码)已经成为长程 Agent 模型降低 Decode 时延的关键,同期 DeepSeek V4 的 DSpark、GLM-5.2 的 IndexShare-MTP、阶跃的 JetSpec 都(准备)在各自的基座中集成推测解码技术。
2026-08-10 22:37:58
237
原创 【清华代码熊】总结|Kimi-K3 后训练算法、模型架构、Infra
📌 今天总结最近解析的 Kimi-K3 后训练算法、模型架构、Infra 相关技术重点。
2026-08-07 21:29:39
28
原创 【清华代码熊】OPD算法Sampled-Token 和 Full-vocab 区别
📌 本期解析:On-Policy Distillation 算法中 Sampled-token OPD / Full-vocabulary OPD的区别?
2026-08-04 20:59:18
177
原创 【清华代码熊】总结|Kimi / GLM / DeepSeek后训练OPD算法
📌 本期对比总结Kimi K3/ GLM 5/ DeepSeek V4 后训练On-Policy Distillation 算法。
2026-08-03 21:32:35
21
原创 【清华代码熊】拆解|Kimi K3 架构:KDA、AttnRes、LatentMoE
📌 本期结合 Kimi K3 技术报告/架构源码拆解架构设计,详解 K3 架构如何支持 1M 上下文拓展、2.8T参数扩容。
2026-08-01 21:15:47
31
原创 【清华代码熊】On-Policy Distillation 正向/反向KL区别?
📌 本期解析秋招提前批面试题:On-Policy Distillation 算法中正向KL / 反向KL区别?sampled-token OPD / Full-vocabulary OPD的区别?
2026-07-27 23:40:08
166
原创 【清华代码熊】On-Policy Distillation 使用 RL 框架实现?
📌 为什么 MiMo-V2-Flash(MOPD)和 GLM-5 通过替换 GRPO 训练框架中的优势项可以实现 OPD。
2026-07-24 02:31:26
19
原创 【清华代码熊】PPO优化算法为什么clip后仍然需要min操作?
📌 今天解析秋招提前批面试题:为什么PPO优化算法中clip之后仍然需要min操作?
2026-07-23 04:05:49
156
原创 【清华代码熊】总结|DeepSeek-V4 后训练算法、架构、Infra
📌 今天汇总一下 DeepSeek-V4 后训练算法、模型架构、Infra 相关技术。
2026-07-20 15:28:46
230
原创 【清华代码熊】总结|GLM-5.2 后训练算法、模型架构、Infra
📌 今天汇总一下 GLM-5.2 后训练算法、模型架构、Infra 相关技术。
2026-07-16 12:21:22
164
原创 【清华代码熊】项目实践17: RFT 冷启动 RL Agent 训练
📌 我们在项目实践:多模态 RL Agent(DAPO算法 & VeRL框架 & Think with images) 里用 DAPO 做的在线 RL:每一步先 rollout、再用 reward 过滤更新。对一个 Instruct 模型来说,初始策略在工具协议下产出可验证答案的概率很低,这会导致:🌟 初期一个 prompt 采样 n 个回答几乎全是 0 reward,DAPO 的动态采样会反复重采、效率低。🌟 模型把算力花在学格式而不是学工具/推理上。冷启动的目标,就是给 RL 一个起始就 r
2026-07-14 17:48:20
187
原创 【清华代码熊】两篇论文看GLM5.2后训练:SAO、CompactionRL
📌 本期解析最近一周智谱&清华的两篇涉及GLM5.2后训练的论文 SAO、CompactionRL。 ↩️ 相比我们之前的理论分析帖子《GLM-5.2 Agentic RL 训练策略拆解:从 GRPO 回到 critic-based PPO》,现在从更官方的角度解析 GLM-5.2 后训练。
2026-07-13 21:52:47
224
原创 【清华代码熊】Qwen/GLM/DeepSeek等基座模型 OPD 技术总结
📌 今天主题:回顾Qwen/Mimo/GLM/DeepSeek各家基座模型中的 On-Policy Distillation(OPD)技术。
2026-07-10 18:28:54
190
原创 【清华代码熊】Agentic RL 开源项目推荐(2026.07版)
📌 本期带来2026年上半年的 Agentic RL 开源项目推荐(简历项目可以基于此实现)筛选了几个方向:🌟 奖励建模改进(Reward Modeling)🌟 上下文压缩与管理(Context Compression)🌟 算法改进(RL Optimization)🌟 探索与数据供给(RL Training Data)
2026-07-06 09:29:14
212
原创 【清华代码熊】解析|DeepSeek DSpark 技术细节 & 代码解读
📌 本期解析最近 DeepSeek 的 Infra 推测解码工作 DSpark,直接用用 DeepSeek 家目前的基座模型 DeepSeek-V4-Pro-DSpark。
2026-07-02 21:42:47
259
原创 【清华代码熊】Agent Harness工程实践(3):Agent验证/测评
📌 今天继续讲 Agent Harness 系列,关注 Agent 测评/验证,通过 SweBench、Terminal-Bench、Tau-Bench 拆解工业界 Agent 测评要点。
2026-06-29 22:24:15
197
原创 【清华代码熊】GLM-5.2 使用的interleaved RoPE 原理详解
📌 GLM-5.2 的主分支注意力改用 DeepSeek 风格的 interleaved RoPE,indexer 仍然用非交错的 half-split RoPE(GLM-5 主分支注意力的实现)。 🎯 今天来解析 interleaved RoPE 相对 half-split RoPE 的区别。
2026-06-27 02:01:44
262
原创 【清华代码熊】Agentic RL 背景下 PPO 为什么优于 GRPO?
📌 今天拆解 GLM-5.2 在长程 Agentic 任务下替换 group-wise GRPO 为 critic-based PPO 的逻辑,结合我们前段时间解析过的🔥 Agentic-RL 算法总结 与 🔥 OPD 算法总结。
2026-06-25 21:21:23
257
原创 【清华代码熊】GLM-5.2 架构源码解析:从 DSA 到IndexShare
📌 本期解析 GLM-5.2架构细节/源代码:🌟 Interleaved RoPE🌟 IndexCache🌟 IndexShare🌟 MTP Index Share🌟 MTP Reject Sampling / TV Loss
2026-06-24 23:54:52
42
原创 【清华代码熊】Agent Harness 工程实践之(2):ToolUse设计
【清华代码熊】Agent Harness 工程实践之(2):ToolUse设计
2026-06-17 16:13:16
248
原创 【清华代码熊】字节面试官:RLVR 本质是一种 SFT? 为什么?
📌 今天解析字节/百度面试题:RLVR(RL with Verifiable Reward)能否认为是一种 SFT?
2026-06-16 10:44:43
192
原创 解析 MiniMax M3 多模态大模型的架构/源码?
📌 本期解析 MiniMax M3 多模态大模型的架构/源码。并且回顾 MiniMax 从 01 到 M3 的发展路线。
2026-06-15 22:34:32
195
原创 【清华代码熊】Agent Harness 工程实践之(1): Context管理
📌 Agent Harness 作为 2026 年上半年 Agent 技术代名词,在讲到具体方法论的时候却又“说不清”。 🔥 这个系列会通过解析 Claude Code / DeepAgents / OpenHands 等框架,通过“了解Harness 工业做法” 学习 Harness。
2026-06-11 15:30:37
257
原创 【清华代码熊】字节面试官:SFT、RL 在Agentic训练中的作用
📌 本期解析字节、淘天的面试题:🌟 如何理解 SFT、RL 在Agentic训练中的作用?🌟 工具调用本身 vs 基于工具结果的后续生成,哪个对 SFT 依赖更大?
2026-06-09 11:48:03
230
原创 【清华代码熊】面试官:Tool Response 需要 Loss Mask吗?
📌 今天解析智谱Agent算法面经:Tool Response 需要 Loss Mask吗?理由是什么?llamafactory 和 verl 里是怎么做的?
2026-06-05 00:47:14
191
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅