LLM
文章平均质量分 92
茫茫人海一粒沙
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
OpenRouter:让我们更自由地使用大模型(以及文档理解)
用户上传一份几十页的 PDF:“帮我总结这份报告的核心结论”“第 3 章的风险点有哪些?你不需要:手写 OCR自己切页、分段、索引再把文本喂给模型一次请求即可完成。OpenRouter 并不是在创造更强的模型,把“如何使用模型”这件事,变得更自由、更工程化。它让我们可以:在模型之间自由切换在文本与真实世界文档之间无缝衔接把复杂度留在基础设施层把注意力留给业务本身对于认真做 AI 工程的团队来说,这是一层非常值得提前引入的能力。参考资料。原创 2026-01-03 20:05:23 · 2734 阅读 · 0 评论 -
大模型中的位置编码详解
绝对位置编码简单,但无法处理长序列和相对位置信息。相对位置编码更强大,但实现复杂。RoPE 通过旋转实现位置感知,兼具直观性和高效性,已成为当前大模型的事实标准。随着 LLM 的发展,位置信息的建模方式也在不断演进,而 RoPE 可能会在相当长的一段时间里继续主导大模型的设计。原创 2025-09-10 18:23:58 · 1234 阅读 · 0 评论 -
GPT 解码策略全解析:从 Beam Search 到 Top-p 采样
策略多样性确定性计算成本典型场景Greedy低高低快速摘要、确定性任务Beam低高高机器翻译、摘要Top-k中中中创意写作、对话Top-p高中中对话、故事生成温度可调可调低调整生成风格。原创 2025-08-15 12:13:19 · 1087 阅读 · 0 评论 -
深入浅出 Multi-Head Latent Attention(MLA):大模型高效推理的秘密武器
传统的 Transformer 模型中,核心计算是通过多头注意力机制(Multi-Head Attention, MHA)实现的。它通过将输入序列的 Query、Key、Value 分成多个头,捕获不同的语义关系。但 MHA 计算复杂度是序列长度的平方(O(N²)),这在长序列或者超大模型中导致推理时资源消耗巨大。MLA 的核心思想是:引入一组“潜变量”(Latent Variables),作为 Query 和 Key/Value 之间的中间桥梁,形成一个低维的瓶颈层,显著降低计算复杂度。原创 2025-07-03 17:28:04 · 2128 阅读 · 0 评论 -
FlashAttention:让大模型飞起来的注意力加速器
先来复习一下 Transformer 里的 self-attention 是怎么工作的。你可以把 self-attention 理解为“每个词看其他词的重要程度”。Q:Query,代表“我要关注什么?K:Key,代表“我是谁?V:Value,代表“我携带的信息”假设你输入一段话有 1000 个词,那么就要对这 1000 个词两两比较,形成一个1000x1000 的矩阵,内存和计算开销非常大,尤其当序列越来越长,比如 8K、16K tokens 时,原始方法就非常吃力了。特性作用。原创 2025-07-03 16:20:30 · 1247 阅读 · 0 评论 -
深入理解大语言模型中的超参数:Temperature、Top-p 与更多
大语言模型中的采样超参数为我们提供了调控输出风格的强大杠杆。控制整体的“随机性”与分布形状;top_p控制输出候选词的“概率覆盖范围”;合理使用其他参数如stopmax_tokens等可以进一步提升生成质量。原创 2025-07-03 12:33:28 · 1936 阅读 · 0 评论 -
深入理解 LoRA:大语言模型微调的低秩魔法
LoRA 是一个优雅的、理论扎实的参数高效微调方法。它基于低秩矩阵近似理论,通过极小的参数改动,完成对大语言模型的任务适配。未来在多任务学习、模型压缩、边缘部署等方向,都有极大潜力。原创 2025-07-02 18:11:55 · 1100 阅读 · 0 评论 -
LayerNorm vs BatchNorm:原理对比、适用场景与计算示例详解
是 Ioffe 和 Szegedy 在 2015 年提出的技术,目的是解决神经网络训练中的**内部协变量偏移(internal covariate shift)**问题。它的核心思想是:对每一层的输出,在 batch 维度上计算均值和方差,使每个特征维度在不同样本上归一化。是 Ba 等人在 2016 年提出的,用于解决RNN和中 batch size 不稳定的问题。其思想是:对每个样本的所有特征维度进行归一化,归一化维度是特征维(feature axis),而非 batch。特性。原创 2025-07-02 17:54:27 · 2004 阅读 · 0 评论 -
Gemini 相关模型汇总
专为机器人设计的 on-device VLA 模型,现已有“Robotics On‑Device”版本,脱离网络端实现低延迟本地部署 (Vertex AI、AI Studio 上已上线 2.5 系列模型,方便开发者调用 (支持处理文本、代码、PDF、图片、音视频,超大上下文窗口(百万令牌) (Gemini CLI:基于 2.5 Pro,支持百万令牌上下文窗口 (支持多模态输入/输出,包括音视频、函数调用、代码执行及搜索引用 (:Pro 系列的 TTS 预览模型,适合生成播客、有声读物场景 (原创 2025-06-30 19:32:16 · 2748 阅读 · 0 评论 -
为什么大语言模型推理要分成 Prefill 和 Decode?深入理解这两个阶段的真正意义
Prefill 阶段是语言模型推理中的第一个步骤,它负责处理你输入的所有上下文内容(prompt),为后续生成打下基础。“请解释一下 Transformer 的原理。这句话会被 tokenizer 编码为一串 token,比如["请", "解释", "一下", "Trans", "##former", "的", "原理", "。"]。然后这些 token 会进入 Transformer 模型进行前向传播。重点来了 👇。原创 2025-04-05 17:13:06 · 11241 阅读 · 0 评论 -
Masked Attention 在 LLM 训练中的作用与原理
这篇文章将帮助你理解 Masked Attention 的作用、实现方式,以及为什么它能确保当前 token 只依赖于过去的 token,而不会泄露未来的信息。如果没有 Masked Attention,模型在训练时可以“偷看”未来的 token,导致它学到的规律无法泛化到推理阶段,从而影响文本生成的效果。虽然 Q, K, V 都计算了,但 Masking 让未来 token 的注意力分数变为 0,确保计算出的 Attention 结果不包含未来信息。,模型会学习到“作弊”策略,直接利用未来信息进行预测。原创 2025-03-29 11:41:23 · 3289 阅读 · 0 评论 -
KV Cache 详解:新手也能理解的 LLM 推理加速技巧
(Autoregressive)生成的,即每次生成一个 token,然后将其作为输入继续生成下一个 token。:如果序列太长,超过了 KV Cache 的存储限制,就需要丢弃最早的 tokens(类似滑动窗口)。时,每次只会生成一个新 token,然后再把这个 token 作为输入继续生成下一个 token。,只缓存计算过的 K,VK, V,每次只计算新 token 的 K,VK, V,从而提升推理效率。:如果输入的 prompt 发生变化,之前的 KV Cache 不能复用,必须重新计算。原创 2025-03-28 21:49:46 · 6955 阅读 · 0 评论 -
NVIDIA GPU 系列简单介绍
NVIDIA 作为全球领先的 GPU 供应商,其产品广泛应用于人工智能 (AI)、高性能计算 (HPC)、游戏、工作站和嵌入式系统等领域。本文将详细介绍 NVIDIA 主要的 GPU 系列,包括其特点和应用场景。原创 2025-03-03 21:53:32 · 2225 阅读 · 0 评论 -
为什么 NVIDIA 仍然在 AI 计算市场保持垄断
虽然 AMD GPU 和华为 Ascend NPU 确实可以运行大语言模型(LLM),但。这是因为 NVIDIA 在。原创 2025-02-26 17:11:04 · 1727 阅读 · 0 评论 -
理解知识蒸馏中的散度损失函数(KLDivergence/kldivloss )-以DeepSeek为例
知识蒸馏(Knowledge Distillation)是一种模型压缩技术,目标是让一个较小的模型(学生模型,Student Model)学习一个较大、性能更优的模型(教师模型,Teacher Model)的知识。这样,我们可以在保持较高准确率的同时,大幅减少计算和存储成本。原创 2025-02-02 12:57:42 · 5085 阅读 · 0 评论 -
DeepSeek 模型全览:探索不同类别的模型
DeepSeek 在 AI 领域的研究覆盖多个重要方向,包括 NLP、代码生成、多模态 AI、数学推理等。无论是开发者、研究人员还是 AI 爱好者,都可以从这些模型中找到适合自己需求的工具。未来,DeepSeek 可能会推出更多创新模型,让我们拭目以待!原创 2025-01-30 17:16:07 · 25921 阅读 · 0 评论 -
使用LoRA对Llama3微调
使用LoRA(Low-Rank Adaptation of Large Language Models)技术对Llama-3语言模型进行微调。原创 2024-08-18 14:22:20 · 4974 阅读 · 8 评论 -
lora 理论篇
在深度学习中,特别是自然语言处理(NLP)领域,预训练语言模型(如GPT、BERT等)已经取得了显著的成果。然而,这些模型通常具有数亿甚至数百亿的参数,在进行特定任务的微调时,所需的计算资源和存储需求非常庞大。LoRA 的提出正是为了解决这一问题。原创 2024-09-01 22:26:53 · 1529 阅读 · 0 评论 -
[Llama3] ReAct Prompt 测试实验
在网上搜索"Harry Styles age"。结果是:”29 years“利用计算器计算29 ^ 0.23。得到:2.169459462491557。然后我在网上查找一下Olivia Wilde's boyfriend.原创 2024-06-08 23:15:31 · 1030 阅读 · 0 评论 -
llama2 , llama3, llama3.1 中提示(prompt)的模板
注意:换行符 (0x0A) 是提示格式的一部分,为了在示例中清晰起见,它们已表示为实际的新行。基本模型支持文本补全,因此任何未完成的用户提示(没有特殊标签)都会提示模型完成它。单个消息的具有可选的 system prompt。为了在示例中清晰起见,它们已表示为实际的新行。系统提示(prompt)是可选的。换行符 (0x0A) 是提示格式的一部分,该模型期望提示末尾的助手标题开始完成它。系统提示以及用户和助手之间的多轮对话。可在此处找到生成此提示格式的代码。可在此处找到生成此提示格式的代码。原创 2024-05-30 22:54:16 · 17155 阅读 · 0 评论 -
LLM提示工程的技巧
在上面的幼儿示例中,更有效的方法可能是为他们拿着的物品命名,带他们走到垃圾桶,向他们展示如何将其扔进去,然后庆祝成功。回到幼儿的例子——如果成人和孩子在一起的环境中,他们不希望孩子触摸附近的物体,因为这些物体易碎、肮脏或禁止进入,那么简单地指导孩子接触附近的物体并不是很有帮助或有效的。同样,通过提供“think step by step”的提示,模型被迫将解决方案分解为多个步骤,而不是仅仅抛出一个大的猜测。这是将事实纳入 LLM 申请的有效方法,并且比微调更经济,微调也可能对基础模型的功能产生负面影响。原创 2024-05-27 21:59:11 · 1016 阅读 · 0 评论
分享