- 博客(272)
- 资源 (10)
- 收藏
- 关注
原创 手撕LLM算法系列(GRPO PPO self-attention MHA MLP)
【代码】手撕LLM算法系列(GRPO PPO self-attention MHA MLP)
2026-09-18 23:12:31
175
原创 大模型训练中的并行策略:DP、ZeRO、TP、PP
ZeRO-3 是“存的时候切开,算的时候还是完整地算”;TP 是“存的时候切开,算的时候也切开算”多张 GPU 既然共同训练一个模型,就没必要每张卡都保存完全相同的训练状态。Data Parallel 是最基础的并行方式,也是Zero 0。每张 GPU 计算其中一部分,然后通过集合通信组合结果。Expert Parallel 主要用于 MoE 模型。Sequence 维度本身也会成为显存和计算瓶颈。它们并不冲突,而是在不同维度上切分同一个训练任务。计算某个 Layer 时,各 GPU 临时通过。
2026-09-16 22:32:06
150
原创 3分钟看懂SGD、Adam与AdamW优化器
初始为 0,每一步都用上一步的值继续更新,因此必须保存。优化器的作用:根据梯度更新模型参数。他的提出是为了防止w一直变大。显存方面,FP32 的。
2026-09-14 19:32:22
192
原创 大模型 Attention 技术梳理:MHA、GQA、MQA、MLA、Sparse Attention 与 KDA
解决:如何通过共享减少 KV CacheMHA → MLA解决:如何通过低维 Latent 压缩 KV Cache解决:如何减少真正参与 Attention 的历史 Token解决:能不能不再保存不断增长的完整历史 KV因此理解现代 Attention 时,不要把这些名词全部放在一条线上。KV 怎么存?历史看多少?而 KDA 则进一步改变了历史信息本身的保存方式。
2026-09-10 11:34:10
373
原创 大模型中BatchNorm LayerNorm RMSNorm区别
方法核心BatchNorm对 Batch 做归一化LayerNorm去中心 + 控尺度RMSNorm只控尺度Post-NormBlock 后再 NormPre-NormBlock 前先 Norm。
2026-09-08 12:37:49
161
原创 Computer Use 与 Browser Use:从界面感知到自动化执行
Computer Use 让 Agent 通过计算机界面完成任务;Browser Use 则针对网页,利用浏览器提供的结构化信息和控制接口完成操作。模型负责选择下一步,外部程序负责读取界面和执行动作。
2026-09-04 14:07:22
360
原创 kl_loss为什么用k3?该放到reward中还是loss中?
两种都可以,目的都是限制 policy 不要离 reference model 太远。当 new policy 和 old policy 很接近,即。所以 KL 是先惩罚 reward,再间接影响 loss。KL 直接作为正则项限制 policy。缺点:它只是近似,因此存在 bias。但这只是常见实现方式,并不是硬性规定。时,KL 可以近似成这个平方形式。缺点:单个样本可能为负,波动较大。优点:期望就是真实 KL,无偏。优点:永远非负,数值比较稳定。
2026-09-03 17:13:14
246
原创 2026 大模型 OPD / MOPD 技术路线对比:Qwen、GLM、Kimi、MiMo、DeepSeek 与 Baichuan
厂商OPD 主要目的Teacher 来源KL 粒度核心特点Qwen3大模型 -> 小模型强 Qwen官方未详细披露用蒸馏代替小模型重新 RLGLM-5防止多阶段 RL 遗忘历史训练 checkpointKimi K3多专家能力融合Domain x Effort 专家每个位置主要使用实际采样 tokenMiMo-V2多专家能力融合多领域 RL 专家系统化 MOPD多专家能力融合多领域专家完整 Reverse KL多专家策略融合多领域 Teacher。
2026-08-24 22:52:05
597
原创 PPO 有了 clip,为什么还需要 min ?
设r=πθ(a∣s)πold(a∣s),ϵ=0.2r=\frac{\pi_\theta(a|s)}{\pi_{\mathrm{old}}(a|s)},\qquad \epsilon=0.2r=πold(a∣s)πθ(a∣s),ϵ=0.2PPO 要最大化:min(rA^, clip(r,0.8,1.2)A^)\min\big(r\hat A,\;\operatorname{clip}(r,0.8,1.2)\hat A\big)min(rA^,clip(r,0.8,1.2)A^)这里的 不
2026-08-17 13:14:04
192
原创 五分钟了解OpenClaw底层架构
OpenClaw 是一个开源的、自托管的 AI Agent 运行时框架,它将大语言模型(LLM)与真实世界的执行面(Execution Surfaces)连接起来:Shell 命令执行、文件系统访问、浏览器自动化、Docker 容器管理,以及超过 20 种第三方消息平台(WhatsApp、Telegram、Discord、Slack、飞书、企业微信等)。
2026-04-27 16:25:18
665
原创 Claude Code源码分析
Claude Code 是 Anthropic 的 CLI 编程 Agent。是一个受控工具循环 Agent——能理解代码库、编辑文件、执行命令、管理 git 的自主编程助手。本篇文章会详细讲解Claude code中的核心设计,详细讲解可以查看参考文献。本篇文章侧重的核心设计包括:Agent Loop、上下文管理、工具管理、skill系统、多Agent架构几部分。层次技术选型说明运行时Bun高性能 JS/TS 运行时,支持编译时 Feature Flag 消除语言TypeScript。
2026-04-14 17:20:26
563
原创 五分钟看懂attetion为什么要除以根号dk
dk\sqrt{d_k}dk除以dk\sqrt{d_k}dk就像是给注意力机制装了一个归一化调节器稳定方差:抵消维度dkd_kdk增大带来的数值膨胀。激活梯度:让 Softmax 避开饱和区,维持梯度的流动性。加速收敛:更稳定的数值分布让模型在训练初期更容易找到优化方向。
2026-04-09 21:25:35
516
原创 五分钟快速了解DPO
DPO 的出现将大模型的对齐从一个“强化学习问题”转化为了一个“有监督的分类问题”。它用极其简洁的数学手段实现了复杂的对齐目标,是目前工业界处理模型偏好学习的首选方案之一。
2026-04-07 23:10:09
465
原创 五分钟读懂RoPE
为了彻底吃透RoPE(旋转位置编码)的精妙之处,我们先从传统位置编码的两个致命痛点说起,然后再详细解剖 RoPE 的运作机制。
2026-04-02 09:54:16
759
原创 LLM中的强化学习方法分类
在大型语言模型(LLM)的后训练(Post-training)阶段,强化学习(RL)已成为实现复杂推理和人类价值观对齐的核心范式。LLM的RL过程本质上是一个在极其庞大且离散的状态-动作空间(State-Action Space,即Token的自回归生成)中进行策略优化的过程。本文从五个核心技术维度对当前LLM领域的RL方法进行分类,并盘点具有代表性的主流及最新算法。
2026-03-19 15:27:50
601
原创 VERL GRPO RL训练显存占用详情
在verl这样的分布式 RLHF 框架中,显存的占用划分为和。两个阶段不断交替,会形成阶段形的GPU使用样例。具体训练和生成的时候显存占用是哪些占用大头是一个需要仔细分析的问题。可以参考此图。
2026-02-26 21:17:28
813
原创 强化学习核心笔记:从 MC 到 GAE 的演进之路
在 PPO(Proximal Policy Optimization)等现代 Actor-Critic 架构中,核心目标是计算。
2026-01-28 11:17:43
606
1
原创 LeetCode高频SQL50题总结
确定数据来源(表、子查询、视图)。如果有连接,先根据 ON 条件生成笛卡尔积,再过滤掉不符合条件的行。过滤行(对原始表数据过滤,还没分组)。按指定字段进行分组,开始“形成小集合”。对分组后的结果再进行过滤(和 WHERE 的区别是它作用于分组之后)。选择要返回的列,执行列表达式、聚合函数。(如果有)去重。对结果排序。返回最终结果的行数限制。
2025-12-27 22:47:48
758
原创 递归、迭代、回溯傻傻分不清?看这一篇就够了
递归 (Recursion) 和 迭代 (Iteration) 是两种解决问题的编程技巧或控制流程。它们描述了代码是如何重复执行的。回溯 (Backtracking) 是一种算法思想或问题解决策略,它通常用来解决搜索问题,而实现回溯最常见的方式就是使用递归。
2025-10-03 21:57:18
1312
原创 算法复习笔记 (LeetCode Hot 100)
这篇博客将hot100按照该学习计划中的类型进行划分,总结了分类型算法的总体思想和每道题的思想,并不包含代码,非常适合复习。
2025-09-30 16:36:44
1500
1
原创 LeetCode31.下一个排序
整数数组的一个就是将其所有成员以序列或线性顺序排列。arr[1,2,3][1,3,2][3,1,2][2,3,1]整数数组的是指其整数的下一个字典序更大的排列。更正式地,如果数组的所有排列根据其字典顺序从小到大排列在一个容器中,那么数组的就是在这个有序容器中排在它后面的那个排列。如果不存在下一个更大的排列,那么这个数组必须重排为字典序最小的排列(即,其元素按升序排列)。[1,3,2][3,1,2][1,2,3][3,2,1]给你一个整数数组nums,找出nums的下一个排列。必须。
2025-04-18 21:32:55
375
原创 LeetCode19.删除链表的倒数第N个节点
给你一个链表,删除链表的倒数第n个结点,并且返回链表的头结点。请用一次扫描实现[1,2,3,5][][1]
2025-04-18 19:39:22
397
原创 轻拍牛头(求约数C++)
今天是贝茜的生日,为了庆祝自己的生日,贝茜邀你来玩一个游戏.贝茜让 N头奶牛(编号 11 到 N)坐成一个圈。除了 11 号与 N号奶牛外,i 号奶牛与 i−1 号和 i+1号奶牛相邻,N 号奶牛与 1 号奶牛相邻。农夫约翰用很多纸条装满了一个桶,每一张纸条中包含一个 1 到 1000000 之间的数字。接着每一头奶牛 i 从桶中取出一张纸条,纸条上的数字用 Ai表示。所有奶牛都选取完毕后,每头奶牛轮流走上一圈,当走到一头奶牛身旁时,如果自己手中的数字能够被该奶牛手中的数字整除,则拍打该牛的头。
2023-09-21 19:39:57
720
原创 越狱(快速幂C++)
监狱有连续编号为 11 到 n 的 n 个房间,每个房间关押一个犯人。有 m 种宗教,每个犯人可能信仰其中一种。不存在没有信仰的犯人。如果相邻房间的犯人信仰的宗教相同,就可能发生越狱。求有多少种状态可能发生越狱。
2023-09-21 17:28:35
1032
原创 序列的第k个数(快速幂的应用C++)
BSNY 在学等差数列和等比数列,当已知前三项时,就可以知道是等差数列还是等比数列。现在给你序列的前三项,这个序列要么是等差序列,要么是等比序列,你能求出第 k项的值吗。如果第 k 项的值太大,对其取模 200907200907。
2023-09-21 17:03:02
496
原创 质数距离(C++筛素数模板题)
给定两个整数 L 和 U,你需要在闭区间 [L,U] 内找到距离最接近的两个相邻质数 C1 和 C2(即 C2−C1 是最小的),如果存在相同距离的其他相邻质数对,则输出第一对。同时,你还需要找到距离最远的两个相邻质数 D1 和 D2(即 D1−D2是最大的),如果存在相同距离的其他相邻质数对,则输出第一对。
2023-09-21 13:59:33
397
原创 AcWing哥德巴赫猜想(C++)筛素数模板题
哥德巴赫猜想的内容如下:任意一个大于 44 的偶数都可以拆成两个奇素数之和。例如:8=3+58=3+5现在,你的任务是验证所有小于一百万的偶数能否满足哥德巴赫猜想。
2023-09-21 02:10:50
292
原创 学习委员(班长、团支书)查作业软件,查人+重命名
作为一个辛勤又负责的学习委员,少不了帮助老师收取作业… 收作业的时候查找谁有没有交是很麻烦的… 所以写个程序来解决这个问题,同时还可以根据名单上的学号序号等,自动添加上学号、序号紫星文件通紫星文件通是一款本地的文件重命名及查人系统。可以通过导入班级成员名单自动查找未提交的同学,也可以自定义进行文件重命名。主要应用场景有:1.学委作业收集重命名 2.收集文件查找没提交成员 3.核酸检测收集后本地的重命名 4.青年大学习收集后本地的重命名。学委文件收集作业收集重命名批量重命名文件重命名班级作业收集
2022-12-05 09:40:14
930
1
planeWar.jar
2021-12-13
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅