LLM大模型组件
文章平均质量分 94
仅记录概要知识,便于自己回顾,内容随时迭代更新,参考文章不再引出,如有侵权,告知,必改
熵增定律28
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
【LLM大模型组件】大模型上下文窗口扩展技术
上下文窗口(Context Window)指模型单次前向传播可处理的最大输入序列长度,直接影响长文本理解、多轮对话连贯性与复杂推理能力。简单来说就是,上下文窗口:就是大模型的“短期记忆力”——它能一次性处理多少文本内容。4K tokens:约3页A4纸的内容(传统模型)32K tokens:一篇完整学术论文或中篇小说:整本《三体》或专业技术手册1M+ tokens:你过去一年的所有聊天记录或整套法律条文。原创 2025-11-05 10:23:20 · 1642 阅读 · 0 评论 -
【LLM大模型组件】注意力机制:Qwen3-Next的架构基石 Gated DeltaNet
维度传统方案价值记忆管理单一机制门控+增量双机制自适应遗忘/更新计算复杂度On2O(n^2)On2OnO(n)On支持100K+上下文真实任务性能次优SOTA适用于工业场景部署成本高极低降低90%+ GPU开销。原创 2025-10-31 16:57:49 · 2181 阅读 · 0 评论 -
【LLM大模型组件】注意力机制:DeepSeek 稀疏注意力机制(DSA)
DeepSeek 稀疏注意力机制(DSA)是一种创新的、由 闪电索引器(Lightning Indexer) 驱动的 动态细粒度稀疏注意力 机制。它将传统自注意力机制的 “选择” 过程与 “计算” 过程解耦,仅对Top-k个最相关的历史词元(Token)进行高精度注意力计算。原创 2025-10-26 13:54:32 · 1943 阅读 · 0 评论
分享