自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+

falldeep的算法世界

一条理工狗

  • 博客(272)
  • 资源 (10)
  • 收藏
  • 关注

原创 手撕LLM算法系列(GRPO PPO self-attention MHA MLP)

【代码】手撕LLM算法系列(GRPO PPO self-attention MHA MLP)

2026-09-18 23:12:31 175

原创 大模型训练中的并行策略:DP、ZeRO、TP、PP

ZeRO-3 是“存的时候切开,算的时候还是完整地算”;TP 是“存的时候切开,算的时候也切开算”多张 GPU 既然共同训练一个模型,就没必要每张卡都保存完全相同的训练状态。Data Parallel 是最基础的并行方式,也是Zero 0。每张 GPU 计算其中一部分,然后通过集合通信组合结果。Expert Parallel 主要用于 MoE 模型。Sequence 维度本身也会成为显存和计算瓶颈。它们并不冲突,而是在不同维度上切分同一个训练任务。计算某个 Layer 时,各 GPU 临时通过。

2026-09-16 22:32:06 150

原创 FlashAttention 与 PagedAttention:分别在优化什么?

在大模型推理中,和。

2026-09-16 21:03:11 238

原创 3分钟看懂SGD、Adam与AdamW优化器

初始为 0,每一步都用上一步的值继续更新,因此必须保存。优化器的作用:根据梯度更新模型参数。他的提出是为了防止w一直变大。显存方面,FP32 的。

2026-09-14 19:32:22 192

原创 大模型 Attention 技术梳理:MHA、GQA、MQA、MLA、Sparse Attention 与 KDA

解决:如何通过共享减少 KV CacheMHA → MLA解决:如何通过低维 Latent 压缩 KV Cache解决:如何减少真正参与 Attention 的历史 Token解决:能不能不再保存不断增长的完整历史 KV因此理解现代 Attention 时,不要把这些名词全部放在一条线上。KV 怎么存?历史看多少?而 KDA 则进一步改变了历史信息本身的保存方式。

2026-09-10 11:34:10 373

原创 大模型中BatchNorm LayerNorm RMSNorm区别

方法核心BatchNorm对 Batch 做归一化LayerNorm去中心 + 控尺度RMSNorm只控尺度Post-NormBlock 后再 NormPre-NormBlock 前先 Norm。

2026-09-08 12:37:49 161

原创 Computer Use 与 Browser Use:从界面感知到自动化执行

Computer Use 让 Agent 通过计算机界面完成任务;Browser Use 则针对网页,利用浏览器提供的结构化信息和控制接口完成操作。模型负责选择下一步,外部程序负责读取界面和执行动作。

2026-09-04 14:07:22 360

原创 kl_loss为什么用k3?该放到reward中还是loss中?

两种都可以,目的都是限制 policy 不要离 reference model 太远。当 new policy 和 old policy 很接近,即。所以 KL 是先惩罚 reward,再间接影响 loss。KL 直接作为正则项限制 policy。缺点:它只是近似,因此存在 bias。但这只是常见实现方式,并不是硬性规定。时,KL 可以近似成这个平方形式。缺点:单个样本可能为负,波动较大。优点:期望就是真实 KL,无偏。优点:永远非负,数值比较稳定。

2026-09-03 17:13:14 246

原创 2026 大模型 OPD / MOPD 技术路线对比:Qwen、GLM、Kimi、MiMo、DeepSeek 与 Baichuan

厂商OPD 主要目的Teacher 来源KL 粒度核心特点Qwen3大模型 -> 小模型强 Qwen官方未详细披露用蒸馏代替小模型重新 RLGLM-5防止多阶段 RL 遗忘历史训练 checkpointKimi K3多专家能力融合Domain x Effort 专家每个位置主要使用实际采样 tokenMiMo-V2多专家能力融合多领域 RL 专家系统化 MOPD多专家能力融合多领域专家完整 Reverse KL多专家策略融合多领域 Teacher。

2026-08-24 22:52:05 597

原创 PPO 有了 clip,为什么还需要 min ?

设r=πθ(a∣s)πold(a∣s),ϵ=0.2r=\frac{\pi_\theta(a|s)}{\pi_{\mathrm{old}}(a|s)},\qquad \epsilon=0.2r=πold​(a∣s)πθ​(a∣s)​,ϵ=0.2PPO 要最大化:min⁡(rA^,  clip⁡(r,0.8,1.2)A^)\min\big(r\hat A,\;\operatorname{clip}(r,0.8,1.2)\hat A\big)min(rA^,clip(r,0.8,1.2)A^)这里的 不

2026-08-17 13:14:04 192

原创 五分钟了解OpenClaw底层架构

OpenClaw 是一个开源的、自托管的 AI Agent 运行时框架,它将大语言模型(LLM)与真实世界的执行面(Execution Surfaces)连接起来:Shell 命令执行、文件系统访问、浏览器自动化、Docker 容器管理,以及超过 20 种第三方消息平台(WhatsApp、Telegram、Discord、Slack、飞书、企业微信等)。

2026-04-27 16:25:18 665

原创 Claude Code源码分析

Claude Code 是 Anthropic 的 CLI 编程 Agent。是一个受控工具循环 Agent——能理解代码库、编辑文件、执行命令、管理 git 的自主编程助手。本篇文章会详细讲解Claude code中的核心设计,详细讲解可以查看参考文献。本篇文章侧重的核心设计包括:Agent Loop、上下文管理、工具管理、skill系统、多Agent架构几部分。层次技术选型说明运行时Bun高性能 JS/TS 运行时,支持编译时 Feature Flag 消除语言TypeScript。

2026-04-14 17:20:26 563

原创 五分钟看懂attetion为什么要除以根号dk

dk\sqrt{d_k}dk​​除以dk\sqrt{d_k}dk​​就像是给注意力机制装了一个归一化调节器稳定方差:抵消维度dkd_kdk​增大带来的数值膨胀。激活梯度:让 Softmax 避开饱和区,维持梯度的流动性。加速收敛:更稳定的数值分布让模型在训练初期更容易找到优化方向。

2026-04-09 21:25:35 516

原创 五分钟快速了解DPO

DPO 的出现将大模型的对齐从一个“强化学习问题”转化为了一个“有监督的分类问题”。它用极其简洁的数学手段实现了复杂的对齐目标,是目前工业界处理模型偏好学习的首选方案之一。

2026-04-07 23:10:09 465

原创 五分钟读懂RoPE

为了彻底吃透RoPE(旋转位置编码)的精妙之处,我们先从传统位置编码的两个致命痛点说起,然后再详细解剖 RoPE 的运作机制。

2026-04-02 09:54:16 759

原创 LLM中的强化学习方法分类

在大型语言模型(LLM)的后训练(Post-training)阶段,强化学习(RL)已成为实现复杂推理和人类价值观对齐的核心范式。LLM的RL过程本质上是一个在极其庞大且离散的状态-动作空间(State-Action Space,即Token的自回归生成)中进行策略优化的过程。本文从五个核心技术维度对当前LLM领域的RL方法进行分类,并盘点具有代表性的主流及最新算法。

2026-03-19 15:27:50 601

原创 VERL GRPO RL训练显存占用详情

在verl这样的分布式 RLHF 框架中,显存的占用划分为和。两个阶段不断交替,会形成阶段形的GPU使用样例。具体训练和生成的时候显存占用是哪些占用大头是一个需要仔细分析的问题。可以参考此图。

2026-02-26 21:17:28 813

原创 强化学习核心笔记:从 MC 到 GAE 的演进之路

在 PPO(Proximal Policy Optimization)等现代 Actor-Critic 架构中,核心目标是计算。

2026-01-28 11:17:43 606 1

原创 Pandas入门指南

总结整理了Pandas的基础语法,直接对应 LeetCode Pandas15 题的考点。

2025-12-28 11:14:32 412

原创 LeetCode高频SQL50题总结

确定数据来源(表、子查询、视图)。如果有连接,先根据 ON 条件生成笛卡尔积,再过滤掉不符合条件的行。过滤行(对原始表数据过滤,还没分组)。按指定字段进行分组,开始“形成小集合”。对分组后的结果再进行过滤(和 WHERE 的区别是它作用于分组之后)。选择要返回的列,执行列表达式、聚合函数。(如果有)去重。对结果排序。返回最终结果的行数限制。

2025-12-27 22:47:48 758

原创 递归、迭代、回溯傻傻分不清?看这一篇就够了

递归 (Recursion) 和 迭代 (Iteration) 是两种解决问题的编程技巧或控制流程。它们描述了代码是如何重复执行的。回溯 (Backtracking) 是一种算法思想或问题解决策略,它通常用来解决搜索问题,而实现回溯最常见的方式就是使用递归。

2025-10-03 21:57:18 1312

原创 算法复习笔记 (LeetCode Hot 100)

这篇博客将hot100按照该学习计划中的类型进行划分,总结了分类型算法的总体思想和每道题的思想,并不包含代码,非常适合复习。

2025-09-30 16:36:44 1500 1

原创 动态规划DP思想总结

记录下每个小问题的最优解,并根据这些小问题的最优解,推导出更大问题的最优解,最终得到原始问题的答案。

2025-09-28 10:26:52 972 1

原创 LeetCode31.下一个排序

整数数组的一个就是将其所有成员以序列或线性顺序排列。arr[1,2,3][1,3,2][3,1,2][2,3,1]整数数组的是指其整数的下一个字典序更大的排列。更正式地,如果数组的所有排列根据其字典顺序从小到大排列在一个容器中,那么数组的就是在这个有序容器中排在它后面的那个排列。如果不存在下一个更大的排列,那么这个数组必须重排为字典序最小的排列(即,其元素按升序排列)。[1,3,2][3,1,2][1,2,3][3,2,1]给你一个整数数组nums,找出nums的下一个排列。必须。

2025-04-18 21:32:55 375

原创 LeetCode19.删除链表的倒数第N个节点

给你一个链表,删除链表的倒数第n个结点,并且返回链表的头结点。请用一次扫描实现[1,2,3,5][][1]

2025-04-18 19:39:22 397

原创 LeetCode25.三数之和

而是要与前一个数比较,不然如[-1, -1, 2]这种情况就会被漏掉。

2025-04-18 18:23:00 348

原创 樱花(筛素数+约数)

给定一个整数 n,求有多少正整数数对 (x,y) 满足 1/x+1/y=1/n!。

2023-09-21 20:28:05 525

原创 轻拍牛头(求约数C++)

今天是贝茜的生日,为了庆祝自己的生日,贝茜邀你来玩一个游戏.贝茜让 N头奶牛(编号 11 到 N)坐成一个圈。除了 11 号与 N号奶牛外,i 号奶牛与 i−1 号和 i+1号奶牛相邻,N 号奶牛与 1 号奶牛相邻。农夫约翰用很多纸条装满了一个桶,每一张纸条中包含一个 1 到 1000000 之间的数字。接着每一头奶牛 i 从桶中取出一张纸条,纸条上的数字用 Ai表示。所有奶牛都选取完毕后,每头奶牛轮流走上一圈,当走到一头奶牛身旁时,如果自己手中的数字能够被该奶牛手中的数字整除,则拍打该牛的头。

2023-09-21 19:39:57 720

原创 越狱(快速幂C++)

监狱有连续编号为 11 到 n 的 n 个房间,每个房间关押一个犯人。有 m 种宗教,每个犯人可能信仰其中一种。不存在没有信仰的犯人。如果相邻房间的犯人信仰的宗教相同,就可能发生越狱。求有多少种状态可能发生越狱。

2023-09-21 17:28:35 1032

原创 序列的第k个数(快速幂的应用C++)

BSNY 在学等差数列和等比数列,当已知前三项时,就可以知道是等差数列还是等比数列。现在给你序列的前三项,这个序列要么是等差序列,要么是等比序列,你能求出第 k项的值吗。如果第 k 项的值太大,对其取模 200907200907。

2023-09-21 17:03:02 496

原创 阶乘分解(筛素数+分解质因数C++)

给定整数 N,试把阶乘 N!分解质因数,按照算术基本定理的形式输出分解结果中的 pi 和 ci 即可。

2023-09-21 15:03:49 628

原创 质数距离(C++筛素数模板题)

给定两个整数 L 和 U,你需要在闭区间 [L,U] 内找到距离最接近的两个相邻质数 C1 和 C2(即 C2−C1 是最小的),如果存在相同距离的其他相邻质数对,则输出第一对。同时,你还需要找到距离最远的两个相邻质数 D1 和 D2(即 D1−D2是最大的),如果存在相同距离的其他相邻质数对,则输出第一对。

2023-09-21 13:59:33 397

原创 AcWing哥德巴赫猜想(C++)筛素数模板题

哥德巴赫猜想的内容如下:任意一个大于 44 的偶数都可以拆成两个奇素数之和。例如:8=3+58=3+5现在,你的任务是验证所有小于一百万的偶数能否满足哥德巴赫猜想。

2023-09-21 02:10:50 292

原创 Spring Data Redis

在pom.xml中添加依赖。

2023-07-26 15:21:49 421

原创 路由器配置方法(固定地址)

校园网配置路由器方式

2023-05-12 22:17:34 11524

原创 SSM框架(SpringBoot快速构建)

快速搭建一个后端Spring程序,Mybatis连接数据库

2023-05-05 19:07:07 1940

原创 Spring 配置Mybatis

Spring已经集成了Mybatis,只需在创建项目时选择Mybatis即可。

2023-05-04 23:49:17 717

原创 Mybatis generator

mybatis generator 简单操作,直接复制粘贴即可

2023-04-14 10:45:43 275

原创 二分查找板子(C++)

区间[l, r]被划分为[l,mid-1]和[mid,r]时使用 寻找右端点时用

2022-12-06 09:48:12 827 1

原创 学习委员(班长、团支书)查作业软件,查人+重命名

作为一个辛勤又负责的学习委员,少不了帮助老师收取作业… 收作业的时候查找谁有没有交是很麻烦的… 所以写个程序来解决这个问题,同时还可以根据名单上的学号序号等,自动添加上学号、序号紫星文件通紫星文件通是一款本地的文件重命名及查人系统。可以通过导入班级成员名单自动查找未提交的同学,也可以自定义进行文件重命名。主要应用场景有:1.学委作业收集重命名 2.收集文件查找没提交成员 3.核酸检测收集后本地的重命名 4.青年大学习收集后本地的重命名。学委文件收集作业收集重命名批量重命名文件重命名班级作业收集

2022-12-05 09:40:14 930 1

java实现大鱼吃小鱼jar可运行文件

java实现大鱼吃小鱼的jar可运行文件

2021-12-05

Mario.zip java实现的马里奥源码

java实现的马里奥源码

2021-12-29

超级马里奥游戏素材.zip

主要包含马里奥游戏的全部图片资源,音乐资源,java多媒体包jl-1.0.1.jar

2021-12-29

Mario.jar(超级马里奥java小游戏,直接可玩)

Mario.jar(超级马里奥java小游戏,直接可玩)

2021-12-29

flappy_bird(qt.5.9.0C++实现)

flappy_bird(qt.5.9.0C++实现)

2021-06-28

flappy_bird图片及音乐资源

flappy_bird图片及音乐资源

2021-07-13

学生信息管理系统.exe

利用python编写的学生信息管理系统,打包成exe文件

2021-11-18

单机版五子棋(qt5.9.0c++实现)

单机版五子棋(qt5.9.0c++实现)

2021-06-28

java实现学生信息管理系统jar可运行文件

java实现学生信息管理系统jar可运行文件,实现了UI界面的设计和数据库的连接

2021-12-03

planeWar.jar

java项目飞机大战 玩法说明 玩家鼠标左键开始游戏,空格键暂停,用鼠标控制我方飞机的移动,当出现的小飞机总数达到50时,敌方boss出现,击败敌方boss游戏胜利。

2021-12-13

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除