- 博客(500)
- 资源 (8)
- 收藏
- 关注
原创 Cross Attention
特性Q, K, V 来源同一个序列 (XXXQQQ来自序列YYY;KVK, VKV来自序列XXX序列长度输入输出长度一致 (L→LL→L输出长度取决于QQQ的长度 (LTL_TLT物理意义建立序列内部 Token 之间的依赖关系融合两个不同模态或不同分布的序列信息KV Cache 更新随着自回归生成不断追加更新通常是静态的(取决于源序列是否变化)
2026-06-05 09:31:35
293
原创 Generalized On-Policy Distillation, G-OPD
这篇文章主要提出了一个名为广义同策略蒸馏(Generalized On-Policy Distillation, G-OPD)奖励外推(Reward Extrapolation, ExOPD)方法。
2026-05-16 12:54:45
582
原创 Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention线性注意力机制详细解读
的。
2026-05-08 19:51:59
549
原创 RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
RT-2 把动作极其细化了。它让每一次末端执行器的移动、每一次夹爪的收缩,都直接受到拥有数百亿参数的互联网常识模型的控制。这就解释了为什么 RT-2 能展现出惊人的泛化能力——因为它不是在机械地记忆动作,而是在用“大脑的常识”直接指挥“手指的微操”。
2026-05-07 17:13:06
398
1
原创 VLA 方向代表性工作
如果你正关注 VLA 方向,建议深入研究RT-2 的 Tokenization 方案以及OpenVLA 的开源实现。在数据层面,目前行业趋势正从“昂贵的专家示教”转向“低成本人体穿戴设备采集”+“仿真数据合成”。对于 AI 研究者来说,VLA 的核心难题在于如何建立有效的atπstgatπstg映射(其中sss为多模态状态,ggg为目标指令,aaa为动作),并解决长序列推理过程中的误差累积问题。
2026-05-07 16:19:45
477
原创 手推 ROPE 的核心公式
模型不需要刻意去学习长序列中每一个绝对位置的含义,它只需要关注 Token 之间的相对远近,这让模型处理超长上下文(Long Context)的泛化能力得到了前所未有的提升。还是你的 Query 在第 1000 个位置,Key 在第 1005 个位置 (二维向量的点积就是**“第一行乘第一行” 加上 “第二行乘第二行”**。无论你的 Query 在第 10 个位置,Key 在第 15 个位置 (组合的项合并在一起。,它们在注意力机制里计算出的关于位置的得分加成,就是。假设我们有两个词,分别位于序列的第。
2026-05-07 12:48:27
271
原创 CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
如果不用 VAE,直接处理。
2026-05-06 20:31:08
638
原创 四个经典的深度学习与 Transformer 基础问题
Softmax 函数的作用是将一个包含任意实数的向量(通常是模型最后一层的原始输出 Logits)映射为一个概率分布。这种设计的巧妙之处在于,它通过不同频率的三角函数,让模型不仅能感知绝对位置,还能通过线性组合推导出相对位置关系,同时保持了维度不变。(这是 768 维模型的标准配置,如 BERT-base 或 GPT-2),那么每个头的维度。接着,模型会生成一个维度完全相同的绝对位置编码矩阵。,并进行张量转置,以便后续按头进行并行矩阵乘法。将所有头的结果拼回原始序列维度。的方式融入模型的,而。
2026-05-06 12:26:52
236
原创 世界模型Genie 论文解读
分词器将你的草图编码为初始的 Tokenz1z_1z1。你输入的离散动作a1a_1a1(比如“向右”)通过查表转化为潜在动作嵌入a1a1。动力学模型接收z1z_1z1和a1a1,预测出下一帧的 Tokenz2z_2z2。最后,分词器的解码器将z2z_2z2解码为真实的图像像素显示在屏幕上。这套架构优雅地将无监督动作发现与高效的大规模视频生成结合在了一起。在这个物理维度上:由于的卷积操作,HHH和WWW。
2026-04-30 16:52:24
553
原创 DeepSeek V4的 OPD 的训练问题
传统的离策略蒸馏 (Off-Policy Distillation / SFT)做法:让强大的 Teacher 模型(如 DeepSeek-V4-Pro-Max)生成海量高质量回答,Student 模型直接拿着这些数据做有监督微调(Behavior Cloning)。致命缺陷 (Exposure Bias):Student 一直在被动模仿 Teacher 的轨迹。
2026-04-27 20:45:11
1778
原创 DeepSeek写的小说,prompt 是“写一个搞 大模型AI 的爽文男主小说,写 5 章内容,剧情搞笑好玩”
【代码】DeepSeek写的小说,prompt 是“写一个搞 大模型AI 的爽文男主小说,写 5 章内容,剧情搞笑好玩”
2026-04-24 16:18:19
347
原创 DeepSeek V4 的架构详解
如果这一层交替到了HCA (重度压缩注意力),整个流程的矩阵维度变换逻辑几乎完全一致,核心区别在于第一步的序列压缩率HCA 的压缩率m′128m' = 128m′128。1000 个 Token 会被极端压缩成1000128≈81000/128≈8个 KV 块。由于序列极短,HCA完全跳过第四步的稀疏选择,Query 直接与这 8 个全局浓缩块(外加 128 个局部滑动窗口块)进行全局注意力计算 [cite: 307]。输出同样经过分组投影,完美还原回。
2026-04-24 13:24:29
1166
原创 ARC-AGI-3
ARC-AGI-3(Abstraction and Reasoning Corpus for AGI, version 3)是当前人工智能领域备受瞩目的新一代基准测试,它标志着 AI 能力评估从静态的"知识问答"转向了动态的"智能体探索"。这项测试旨在衡量 AI 是否具备在完全陌生的环境中,像人类一样通过探索、推理和适应来解决问题的能力,这被认为是通向通用人工智能(AGI)的关键一步。
2026-04-18 11:22:17
648
原创 Model Self-Evolution (MIniMax M2.7)
简单来说,M2.7 不再仅仅是一个回答问题的“大脑”,它还自带一套**“健身房”和“教练系统”**,这套系统被称为(智能体执行框架)。自主诊断:它能分析自己在哪类任务(比如复杂的 Python 并发优化)上失败了。自主实验:它会尝试修改自己的脚手架代码(Scaffold Code),或者搜索更优的采样参数(如 Temperature 或 Penalty 组合)。自主评测:运行内部测试集,对比改进前后的效果。自主决策:如果变更好,就合入主分支;如果变差,就自动回滚。
2026-03-18 16:46:28
503
原创 怎么把claude code的claude模型的url和key永久设置成自己的
每次打开终端都要手动输入export确实非常繁琐。要让这些配置永久生效,你需要将export命令写入到你电脑终端(Shell)的默认配置文件中。这样,每次打开新的终端窗口时,系统都会自动为你加载这些变量。
2026-03-15 11:21:13
505
原创 MoM (Mixture-of-Memories)新型线性序列建模架构
在推理时,通过加权求和(Weighted Sum)混合这些记忆产生的输出,使得推理复杂度保持在 (常数级内存),没有 Transformer 那样随着序列增长而无限膨胀的 KV Cache。(如 Mamba, RWKV, RetNet)虽然训练快()、推理省内存(),但它们通常将整个输入序列压缩进**一个固定大小的记忆状态(Memory State)**中。,根据输入内容的重要性,将不同的 Token 导向不同的记忆单元进行存储。效果好,但推理成本高(KV Cache 显存占用大),复杂度是。
2025-12-24 20:05:07
1546
原创 Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models(超长文本模型论文HSA)
论文旨在解决 LLM 如何实现“无限”记忆的问题。稀疏性(不能全关注)、随机访问灵活性(能精准检索过去的信息)和长度外推性(从短训练推广到长推理)。现有的方法(如 Mamba、线性注意力、NSA)在检索精度或长距离外推上存在短板。HSA-UltraLong 通过结合滑动窗口注意力(SWA)和HSA,模仿了“混合专家模型(MoE)”的思路,实现了高效且精准的超长文本检索与生成。
2025-12-21 16:31:53
1196
原创 Olmo3论文精读
整个管线极度依赖高质量数据工程(olmOCR、合成数据、微退火筛选)。将训练拆解为 Pretrain -> Midtrain -> LongContext -> SFT -> DPO -> RL,每个阶段都有明确的目标和特定的数据配比。大规模应用基于规则验证(如代码执行、数学答案匹配)的强化学习(RLVR),这是提升推理能力的关键。提供了复现上述所有步骤所需的工具链(Olmo-core, OlmoRL, Dolma3, Dolci)。Olmo 3 预训练详解在 Olmo 3 的。
2025-12-14 13:31:39
1372
原创 BPB(Bits Per Byte)和 PPL(Perplexity,困惑度)的区别
PPLBPB关注点每 token 的预测不确定性每字节的信息编码效率是否受 tokenizer 影响是否在验证小模型时的优势传统、直观更公平、更适合数据策略比较本质关系都源于交叉熵,只是归一化方式和单位不同所以,在大规模训练前用BPB来验证数据清洗和混合策略,是一种更鲁棒、更底层的评估方法。
2025-12-14 12:27:50
814
原创 Token 和字节之间的换算
在大语言模型中,Token与字节的换算关系并非固定,主要取决于分词器和文本内容。以BPE分词器为例,英文字母通常1字节对应1Token,而中文汉字3字节通常对应1Token。具体换算需根据实际文本分析:英文"aaa"可能3字节对应1Token,中文"你好"6字节对应2Tokens。标点符号也存在差异,全角中文标点3字节对应1Token,而英文标点1字节对应1Token。精确计算需要使用分词器实测,总体而言英文1Token≈3-5字节,中文1Token≈1.5-3字节。
2025-12-14 12:23:57
3327
原创 如何上传github和huggingface(解决git的时候输入正确的账号密码,但提示认证失败)
然后终端输入下面,clone到本地(完成后发现会发现本地有新的文件内容)配置ssh上传,终端输入下面命令,换为刚才第二步生成的密钥。把新文件移到clone下来的文件夹后,add+commit。新建仓库,建议直接网站上New1个。点击New SSH Key。名字随便取,可以自己方便记。然后push到github。点code,然后复制这里。删除文件夹,直接终端操作。删除文件,直接终端操作。
2025-07-18 22:07:49
884
原创 PyTorch Tensor 形状变化操作详解
在深度学习中,Tensor 的形状变换是非常常见的操作。PyTorch 提供了丰富的 API 来帮助我们调整 Tensor 的形状,以满足模型输入、计算或数据处理的需求。本文将详细介绍 PyTorch 中常见的 Tensor 形状变换操作,并通过示例代码进行说明。
2025-02-17 17:00:46
1120
原创 使用deepspeed的zero3的offload参数时报错return tensor.pin_memory(), RuntimeError: CUDA error: invalid argument
是硬盘存储空间不够导致的,删掉些东西就好了。
2025-02-14 11:43:35
573
原创 DeepSeek-R1中训练使用的GRPO奖励函数公式详细讲解
相比较PPO,GRPO(Group Relative Policy Optimization)的训练成本会更低,更简单。通俗的理解,当两个分布一致时,下面的公式第一项为 1,第二项为0,计算后总的值为0,即惩罚项为0。散度,避免训练后的模型输出分布与之前的分布相差太大。模型会在一组输出上更新几轮,我们训练的目标是更新。的概率高),这样模型的第一项结果就更大(我们需要最大化这个公式)。:如下,KL散度用于避免训练后模型的输出分布和原模型相差太大(通过奖励模型获得的奖励值。的一项是优化模型能输出更高优势。
2025-02-12 16:37:08
2096
原创 Deepspeed的zero2和zero3的配置文件Demo
使用下面这个文件,在8*H100的机器上训练了Qwen2.5-32B模型。上下文窗口8K,batch_size = 8(num_gpu)*2(per_gpu_batch_size)*8(gradient_accumulation_steps) =128,deepspeed采用zero3,显存占用约65G,内存占用约653G(还有数据占的显存,数据量为0.06B tokens),训练时长2 hour。使用下面这个文件,在8*H100的机器上训练了Qwen2.5-7B模型。
2025-02-09 16:44:54
1320
原创 加快训练LLM速度的技巧笔记
解释:如下图,相比fp32,bf16的表示范围不变(还是e8),但精度从m23降到了m7,但在大模型训练时,这种精度损失是可接受的。需要注意,有些老的gpu不支持这个操作。一些新一点的4090,A100,H100等均支持。解释:python的gcc编译优化(优化代码底层执行指令,主要优化了代码中对gpu的读写操作,不影响任何性能),在训练前会花费时间进行编译,但大大加快训练时速度。需要注意,windows用不了。
2024-11-24 11:18:30
963
原创 ubuntu递归下载deb安装包,解决离线依赖问题
换成自己需要安装的包,虽然下面代码会递归下载依赖安装包,但是在离线环境下仍然可能会出现依赖包为配置问题。最后,把所有安装包移到离线电脑上的一个文件夹后,使用下面命令安装deb包。如果出现反配置问题,可以使用下面的命令自动反配置来强制安装某些包。主要针对离线环境的电脑安装deb包。所有安装包都不报错才能安装成功。
2024-07-25 16:17:46
1989
大模型指令微调概述,大模型微调简单介绍ppt
2023-10-30
免费领取阿里云资源部署大模型ChatGLM2,可以训练
2023-10-30
NSGA-II多目标优化算法小白详细介绍ppt
2022-12-21
Transformer深度讲解,进一步给出其在NLP和CV下的发展,共95页ppt,全网最好的讲解,没有之一
2022-12-21
GNN,GCN,图神经网络深度讲解100页ppt 包括基础的GNN和其多个变体
2022-12-19
CNN卷积神经网络讲解50多页PPT 卷积核,感受野,池化核多原理讲解
2022-11-22
自动编码器,多种自编码器深入浅出介绍,包括SAE,CAE,DAE,VAE
2022-11-22
生成对抗网络GAN( Generative Adversarial Networks)63PPT,GAN原理,介绍,变体详细
2022-11-22
RNN循环神经网络PPT,涉及到LSTM,GRU、BRNN、BLSTM等等介绍,适合开会用,总共有50页,干货满满
2022-11-22
全连接神经网络(多层感知机)PPT,可以直接开会讲
2022-11-22
2009B眼科病床合理安排.rar
2020-08-22
2006B艾滋病疗法评价.rar
2020-08-22
最佳灾情巡视路线优秀论文.rar
2020-08-19
2016年国赛A题题目.rar
2020-08-16
2016年国赛A题“系泊系统的设计”附件
2020-08-16
PDF转换软件.zip
2020-06-17
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅