<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[WitsMakeMen的专栏]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/WitsMakeMen</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; WitsMakeMen]]></copyright><item><title><![CDATA[RankMixer论文理解]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/159655264</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/159655264</guid><author>WitsMakeMen</author><pubDate>Mon, 30 Mar 2026 21:12:30 +0800</pubDate><description><![CDATA[RankMixer主要是为了解决传统模型基于CPU时代设计模型MFU计算低效，不能很好的进行模型ScalingLaw扩展的问题。算法通过两步运算TokenMixing和PFFN，将特征在mixing阶段进行充分的混合，然后在PFFN阶段进行每个混合Token充分的交叉学习，可以学习出更多的高阶特征。]]></description><category></category></item><item><title><![CDATA[relu激活函数为什么有效]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/159654888</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/159654888</guid><author>WitsMakeMen</author><pubDate>Mon, 30 Mar 2026 20:24:32 +0800</pubDate><description><![CDATA[ReLU（Rectified Linear Unit）之所以有效，核心原因可以用一句话概括：它简单、计算快、能缓解梯度消失，还天然带来稀疏性，非常适合深度神经网络。]]></description><category></category></item><item><title><![CDATA[rq-vae训练过程是什么样的]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/159395768</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/159395768</guid><author>WitsMakeMen</author><pubDate>Mon, 23 Mar 2026 21:50:40 +0800</pubDate><description><![CDATA[RQVAE]]></description><category></category></item><item><title><![CDATA[PPO算法原理]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/159214224</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/159214224</guid><author>WitsMakeMen</author><pubDate>Wed, 18 Mar 2026 21:42:44 +0800</pubDate><description><![CDATA[核心目标：解决传统策略梯度 “更新幅度不可控” 的问题，通过 Clip 操作限制新 / 旧策略的差异；稳定关键：用 GAE 计算优势函数，平衡方差和偏差，让训练更稳定；效率关键：多轮 Epoch 训练同一批数据，提升数据利用率；实现核心：Clip 操作（限制策略更新比例）+ 同时优化策略 / 值函数 + 熵奖励（鼓励探索）；RLHF 适配：奖励由 “人类反馈（奖励模型）+ KL 惩罚” 组成，避免模型生成无意义内容。]]></description><category></category></item><item><title><![CDATA[RoPE 算法原理？算法为什么只和相对位置有关]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/159009962</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/159009962</guid><author>WitsMakeMen</author><pubDate>Fri, 13 Mar 2026 15:06:34 +0800</pubDate><description><![CDATA[RoPE的核心作用：给LLM的token特征向量注入相对位置信息，解决传统位置编码长序列泛化差的问题；核心原理：通过对特征向量做“旋转操作”，让Attention内积只依赖token间的相对位置，旋转角度由「位置ID × 逆频率」计算；核心优势：相对位置感知、超长上下文泛化、无额外参数、计算高效，成为LLaMA/Qwen等主流LLM的标配位置编码方案。绝对位置：token 的位置是 “孤立的”（比如 pos=3 就是第 3 个 token，和其他 token 无关）；]]></description><category></category></item><item><title><![CDATA[slice作用]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/158976812</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/158976812</guid><author>WitsMakeMen</author><pubDate>Thu, 12 Mar 2026 20:20:48 +0800</pubDate><description><![CDATA[创建slice对象：start=起始索引，stop=结束索引，step=步长（都可选）start：默认 None（从开头开始）stop：必填（切到该索引前停止，不包含）step：默认 None（步长为 1）slice 是 Python 内置类，用来定义「切片规则」（start/stop/step），a[start:stop:step] 本质是创建了 slice 对象；]]></description><category></category></item><item><title><![CDATA[rankerMixer为什么能提升系统的MFU]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/158934652</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/158934652</guid><author>WitsMakeMen</author><pubDate>Wed, 11 Mar 2026 21:41:19 +0800</pubDate><description><![CDATA[通过无参数 Token Mixing、大 GEMM 主导的 PFFN、语义化分词的架构创新，从根源消除传统模型的碎片化计算和显存密集型操作，让模型计算天然适配 GPU 的并行特性；再通过核融合、参数量与 FLOPs 解耦、资源瓶颈转移的工程优化，将 GPU 的计算资源从显存 IO 的闲置状态中释放，最终实现模型从 “显存受限” 到 “计算受限” 的转变，让 MFU 实现 10 倍的跨越式提升。]]></description><category></category></item><item><title><![CDATA[优化器状态也放 CPU（CPUOffload）具体做法]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/158422124</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/158422124</guid><author>WitsMakeMen</author><pubDate>Thu, 26 Feb 2026 11:58:12 +0800</pubDate><description><![CDATA[核心逻辑：优化器状态（m/v）放 CPU，更新时临时传 GPU，更新后传回 CPU，全程不影响梯度计算的正确性；实现方式：优先用 fairscale 的 CPUOffloadOptimizer（开箱即用），定制化需求可手动实现（核心是状态的 CPU-GPU 按需传输）；兼容性：完全兼容你「边算梯度边更新权重」的思路，只需保证更新时用的是后一层的原始权重，Offload 仅改变状态的存储位置。]]></description><category></category></item><item><title><![CDATA[LLM基座发展动向（2026最新·详细版）]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/158039340</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/158039340</guid><author>WitsMakeMen</author><pubDate>Fri, 13 Feb 2026 14:07:55 +0800</pubDate><description><![CDATA[核心结论：从参数竞赛→效率革命；从单模态→原生多模态；从静态生成→动态推理/记忆/Agent化；从通用→垂直/轻量化，四大主线并行演进。LLM基座发展动向（2026最新·详细版）]]></description><category></category></item><item><title><![CDATA[10 年后 AGI 能否出现？将如何影响人类生活？]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/157221561</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/157221561</guid><author>WitsMakeMen</author><pubDate>Wed, 21 Jan 2026 19:49:24 +0800</pubDate><description><![CDATA[10 年后（2036 年）出现初级 AGI 的可能性较大，但实现完全人类水平 AGI 仍存巨大不确定性。]]></description><category></category></item><item><title><![CDATA[Qwen 3 技术解析：通过强化学习和思维模式融合提升模型对齐]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/157215335</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/157215335</guid><author>WitsMakeMen</author><pubDate>Wed, 21 Jan 2026 15:11:25 +0800</pubDate><description><![CDATA[今天为大家分享近期阿里发布的Qwen3技术报告，特别是Qwen3如何通过一系列精密的后训练（Post-training）过程，从一个强大的基础模型，蜕变成一个更加智能、灵活、且与人类偏好高度对齐的助手。这就像是给大模型装上了“智慧大脑”和“沟通桥梁”的升级过程。]]></description><category></category></item><item><title><![CDATA[用矩阵实例具象化 RankMixer 核心机制]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/156954388</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/156954388</guid><author>WitsMakeMen</author><pubDate>Wed, 14 Jan 2026 21:58:44 +0800</pubDate><description><![CDATA[结合文档中 100M 参数模型的典型配置（T=16 个特征 Token、D=768 隐藏维度、H=16 个头），通过具体矩阵维度和运算过程，拆解 RankMixer 核心模块的矩阵操作逻辑，让抽象架构落地为可感知的数值流程。]]></description><category></category></item><item><title><![CDATA[BLEU计算原理]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/156913779</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/156913779</guid><author>WitsMakeMen</author><pubDate>Tue, 13 Jan 2026 21:48:56 +0800</pubDate><description><![CDATA[计算高效、完全自动化：无需人工参与，适合大规模生成任务的快速评估（如 LLM 批量生成广告文案）；可解释性强：n-gram 匹配直接反映文本的词汇和短语重合度，与人类对「流畅度」的直觉部分契合；支持多参考文本：可输入多份人工参考文本（如同一广告卖点的不同表述），提升评估准确性。BLEU 是文本生成任务的基础自动评估指标，核心通过 n-gram 匹配度衡量生成文本与人工参考文本的相似度，同时惩罚短文本。]]></description><category></category></item><item><title><![CDATA[理解ppl指标]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/156913318</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/156913318</guid><author>WitsMakeMen</author><pubDate>Tue, 13 Jan 2026 21:20:42 +0800</pubDate><description><![CDATA[直观理解：PPL 是模型预测下一个 token 的「平均困惑程度」，越低说明模型越 “确定”，语言建模能力越强；本质理解：PPL 是平均交叉熵损失的自然指数，是为了直观对比而做的指标转换，二者趋势完全一致；实用理解：PPL 是 “相对对比指标”，需在同一独立测试集上使用，过滤无效 token，且不能作为唯一评估标准，需结合下游任务指标。]]></description><category></category></item><item><title><![CDATA[SLMRec 论文中解决Dnorm​损失多层收敛不稳定的「核心 3 个技术方案」（论文原文答案，全部是技术亮点）]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/156690440</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/156690440</guid><author>WitsMakeMen</author><pubDate>Wed, 07 Jan 2026 16:02:22 +0800</pubDate><description><![CDATA[SLMRec 通过分块层对齐 + 教师特征 Detach 冻结 + 分层衰减权重 λ₂，解耦多层梯度冲突，固定拟合锚点，平衡层间收敛节奏，彻底解决 D_norm 多层收敛不稳问题。]]></description><category></category></item><item><title><![CDATA[SLMRec 详细介绍（重点：损失函数）]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/156570843</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/156570843</guid><author>WitsMakeMen</author><pubDate>Sun, 04 Jan 2026 15:56:10 +0800</pubDate><description><![CDATA[SLMRec 是面向序列推荐（SR） 的小语言模型，核心目标是解决大语言模型（LLM）在序列推荐中参数冗余、部署低效的问题。其核心思路是通过分层知识蒸馏，将深层 LLM（教师模型）的关键知识迁移到浅层小模型（学生模型），仅用 LLM 类推荐模型 13% 的参数，就实现了相当甚至更优的性能，同时训练 / 推理速度分别提升 6.6 倍和 8.0 倍。模型采用师生架构：教师模型为深层 LLM（如 LLaMa-7B），学生模型为同隐藏维度的浅层 LLM；]]></description><category></category></item><item><title><![CDATA[qwen3 训练loss 出现nan]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/156397747</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/156397747</guid><author>WitsMakeMen</author><pubDate>Mon, 29 Dec 2025 21:06:02 +0800</pubDate><description><![CDATA[在 Qwen3 的训练 / 微调过程中，loss 变为 NaN（Not a Number，非数字） 是数值计算完全失效的核心标志，意味着模型在损失函数计算、梯度传播环节出现了无法被计算机解析的无效数值运算—— 这不是 “模型学不好（loss 高）”，而是 “训练流程本身崩溃”，继续训练会导致参数更新完全失效（参数也会变成 NaN），必须立即停止并排查问题。]]></description><category></category></item><item><title><![CDATA[训练时开启 KV 缓存会和is_causal=False 冲突]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/156393118</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/156393118</guid><author>WitsMakeMen</author><pubDate>Mon, 29 Dec 2025 17:09:39 +0800</pubDate><description><![CDATA[KV 缓存与 is_causal=False 冲突的本质是：KV 缓存的设计根基是「因果掩码（is_causal=True）+ 逐 token 生成」，而 is_causal=False 打破了 “因果限制”，且训练场景本身无需 KV 缓存，两者从逻辑、维度、场景上完全不兼容。对于你的核心需求（训练 Qwen3 时禁用因果掩码），训练阶段必须禁用 KV 缓存（这也是行业通用做法）；若需推理时禁用因果掩码，同样要关闭 KV 缓存，或改用全序列一次性输入的推理方式（而非逐 token 生成）。]]></description><category></category></item><item><title><![CDATA[大语言Qwen3模型QA训练数据如何生成]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/156386678</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/156386678</guid><author>WitsMakeMen</author><pubDate>Mon, 29 Dec 2025 12:07:09 +0800</pubDate><description><![CDATA[对 Qwen3 等 Decoder-only 模型而言，QA 数据输入构造的本质是“将问答对转换为符合对话模板的连续序列，通过 labels 屏蔽实现‘根据 Question 生成 Answer’的训练目标”，这是实现高质量问答能力的基础。]]></description><category></category></item><item><title><![CDATA[scaled_dot_product_attention实现]]></title><link>https://blog.csdn.net/WitsMakeMen/article/details/156309492</link><guid>https://blog.csdn.net/WitsMakeMen/article/details/156309492</guid><author>WitsMakeMen</author><pubDate>Fri, 26 Dec 2025 16:43:03 +0800</pubDate><description><![CDATA[SDPA 是 Transformer 注意力机制的核心，公式如下：关键要素：以下是纯 PyTorch 手动实现的 SDPA，包含缩放、注意力掩码、因果掩码核心逻辑，注释详细且适配新手理解：
手动实现的测试示例（模拟 Qwen3 单 head 场景）

mask作用
mask主要是屏蔽掉attention矩阵无效的权重，]]></description><category></category></item></channel></rss>