- 博客(66)
- 资源 (3)
- 收藏
- 关注
原创 第5章 GPTQ 实战:如何把 Hugging Face 模型量化成 4-bit
本章详解GPTQ量化技术,聚焦如何将Hugging Face模型高效压缩至4-bit。GPTQ作为后训练量化方法,通过校准数据(Calibration Dataset)捕捉输入分布,利用近似二阶信息(Hessian)评估权重敏感度,最小化输出重构误差 $ |WX - W_qX|^2 $,实现精准误差补偿。相比简单四舍五入,GPTQ能显著降低精度损失,尤其适合4-bit场景。实战中需合理选择校准数据、配置Group-wise量化与参数,最终在保持模型性能前提下大幅减少存储与显存占用。
2026-09-18 23:01:25
317
原创 第4章 LLM 4-bit 量化实战:LLM 4-bit 量化到底意味着什么?
前面第1章和第2章,我们已经回答了两个基础问题:因为模型参数越来越大,FP16/BF16 权重会占用大量显存和存储空间。ContinuousValue→DiscreteValue并通过:xqroundxs将高精度浮点数映射到低比特整数表示。PostTrainingQuantization即模型训练完成以后再进行量化。4−bit到底意味着什么?为什么从:FP。
2026-09-18 16:19:51
603
原创 三星把 Mistral AI 搬进晶圆厂——一文看懂 AI 如何进入半导体制造
三星使用 Mistral AI 模型制造芯片”的新闻。第一阶段,我们让 AI “会说话”。第二阶段,我们让 AI “会理解”。第三阶段,我们让 AI “会预测”。让 AI 参与真实世界的决策。这也是为什么未来真正值得关注的 AI,不一定只是参数更大的模型。模型如何连接数据,如何连接专业知识,如何连接优化算法,以及最终如何连接真实世界的生产系统。三星把 Mistral AI 放进半导体制造体系,本质上就是这样一个案例。AI 的终点并不是聊天窗口。
2026-09-16 23:21:53
223
原创 第3章 PTQ:不用重新训练也能量化 LLM
先看最简单的过程:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;原始训练PTQ部署模型已经训练完成,量化是在训练结束之后进行的。
2026-09-16 20:00:00
125
原创 第2章 什么是量化?用 3 个数字算懂 INT8
因为模型参数越来越多,FP16、BF16 等高精度表示会带来巨大的存储和显存压力。例如一个 7B 模型7B×2Bytes≈14GB,降到 INT8 约 7GB,降到 INT4 约 3.5GB。例如有一个模型参数x1.273,我们希望把它变成一个 8-bit 的整数。难道直接1.273→1就可以了吗?当然不行。那么大量原本不同的浮点数都会被压缩成同一个整数,信息损失会非常严重。因此,真正的量化不是简单地"Float → Int",而是:fill:#333;important;
2026-09-15 22:31:47
206
原创 第1章 为什么 LLM 一定会走向量化?
这里的7B7B7B表示7B7×1097B7×109,即大约70 亿个参数。模型规模参数数量1B10 亿3B30 亿7B70 亿13B130 亿70B700 亿B 指 Billion,即十亿。因此,7B 并不是"模型文件大小为 7GB",它只是表示模型中大约有 70 亿个可学习参数。每个参数使用多少 bit 来存储。一个参数到底占多少字节?Quantization(量化),就是把高精度数值表示映射到更低比特的离散数值表示。例如原始模型参数x。
2026-09-15 21:48:45
114
原创 AI开始进入CNC加工——CloudNC如何用AI从CAD模型走向机床 2/2
CloudNC 获得 2000 万美元融资当然是新闻本身。但从技术角度,更值得关注的是它代表了一条非常明确的路线:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;CAD工程师CAMCNC正在逐渐变成:fill:#333;important;important;fill:none;color:#333;color:#333;
2026-09-15 13:11:02
251
原创 AI开始进入CNC加工——CloudNC如何用AI从CAD模型走向机床 1/2
让程序员可以逐步查看和控制 AI 的加工策略决策。其官方介绍强调,工程师可以在刀路发送回 GibbsCAM 等 CAM 软件之前,对 AI 建议进行检查和控制。CloudNC 官方也明确强调 CAM Assist 的设计目标是让人保持对加工过程的控制,而不是简单地把工程师从流程中拿掉。而这,正是下面要讲的 Physical AI 真正有意思的地方。的应用,同时推动新的 AI 产品,包括面向加工报价和估算的。这正是理解制造业 AI 的关键。,计划进一步扩大其 AI 精密加工技术在全球供应链中的应用。
2026-09-15 13:09:14
95
原创 Transformer与大语言模型:第19章 RAG(Retrieval-Augmented Generation)
本章系统讲解RAG(检索增强生成)技术,涵盖从文档分块、向量化存储到检索生成的全流程。重点剖析Chunking策略对效果的关键影响,强调语义切分与变长分块的优势,指出其在连贯文本中易超限的缺陷,并提出结合最大长度限制与LLM智能切分的优化方案。通过向量检索、重排序及Prompt工程,实现精准问答,有效缓解大模型的知识截止与幻觉问题。最后介绍端到端评估体系,强调以下游任务效果为核心,控制变量进行科学验证。
2026-09-12 22:50:48
252
原创 Transformer与大语言模型:第18章 向量数据库
本章介绍向量数据库的核心原理与关键技术。针对海量向量相似度搜索的效率问题,引入近似最近邻(ANN)算法,重点讲解HNSW(分层导航小世界图)、IVF(倒排文件索引)和PQ(产品量化)等主流索引方法。HNSW通过多层稀疏至密集的图结构实现高效粗粒度到细粒度导航;IVF基于聚类缩小搜索范围;PQ则通过分段量化大幅压缩存储。结合FAISS、Chroma等工具示例,展示如何在实际中构建高效向量检索系统,适用于文本、图像等语义搜索场景。
2026-09-11 23:53:10
361
原创 Transformer与大语言模型:第17章 Embedding Model
fill:#333;important;important;fill:none;架构双向Attention输出固定维度向量从Token到句子Mean Pooling 最常用Last-token Decoder用L2 归一化训练对比学习正负样本对温度参数 τ主流模型BGE 中文最强E5 微软GTE 阿里Jina 长文本应用语义搜索文本聚类RAG检索。
2026-09-11 15:16:26
134
原创 用 AI 重新计算物流:从路线预测走向实时决策计算
如果只把 MG Ship 理解成"一家物流公司推出了 AI 路线规划功能",那么其实低估了这件事情。物流 AI 正在从预测系统向决策系统演进。过去 AI 说的是"这批货可能晚三天"。现在 AI 说的是:如果继续走当前路线,预计延误 3 天;如果切换路线 B,成本 +8% 但延误概率下降 23%;如果更换承运商 C,成本 +4% 但准时率提高 12%;综合成本、时效和风险后,推荐路线 B + 承运商 C。这才是真正有业务价值的 AI。因此未来我们理解 AI 基础设施时,不能只问"这个系统用了什么模型?
2026-09-10 22:18:31
307
原创 一文读懂传统搜索与 AI 搜索:从网页排名到答案生成,YouTube 53.1% 案例解析
一项研究揭示,Google AI Overview中YouTube视频被引用率达53.1%,远超传统权威医疗网站。这背后是搜索范式从“找网页”向“找答案”的转变:传统搜索依赖网页排名,而AI搜索通过多源信息检索、理解与融合,生成综合答案。关键差异在于,AI更关注信息的可引用性而非页面排名,导致内容来源多元化,甚至非传统权威平台也能脱颖而出。这一变化标志着搜索正从“文档召回”迈向“信息生成”,用户不再仅需点击阅读,而是依赖系统整合与验证。
2026-09-10 22:17:38
738
原创 从聊天机器人到 AI Companion:AI 如何进入人的长期关系
传统互联网产品是"用户 → App → 功能"的单向关系,而 AI 产品的箭头已经变成双向,并进一步延伸出记忆、上下文、个性化:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;用户AIMemoryContext。
2026-09-09 15:31:45
86
原创 M&T Bank 如何把 AI 真正部署到 15000 多名员工:企业 AI 落地的关键不是模型,而是基础设施
现在很多 AI Agent 的宣传是"Agent 自主思考 → 自主调用工具 → 自主执行"。但银行不能简单采用这种模式,而更可能采用一条带治理关卡的链路:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;AI AgentRisk CheckExecution因此企业 Agent 真正落地之后,很可能不是,而是。
2026-09-08 00:16:11
223
原创 Transformer与大语言模型:第16章 MoE:混合专家架构
fill:#333;important;important;fill:none;MoE 混合专家核心思想一个FFN变多个FFNRouter动态选Top-K参数与计算解耦Routersoftmax打分Top-K选择加权求和工程难点负载均衡All-to-All通信现代设计代价显存不省系统复杂度高需要更多数据。
2026-09-07 23:36:22
387
原创 Transformer与大语言模型:第15章 Qwen、Llama、DeepSeek:现代 LLM 的技术细节
自回归生成时,每次生成新 Token 都需要计算所有历史 Token 的 K 和 V。生成第 n 个 Token 时,需要重新计算前 n-1 个 Token 的 K 和 V时间复杂度:O(N²)缓存前 n-1 个 Token 的 K 和 V生成第 n 个 Token 时,只需计算新 Token 的 K 和 V时间复杂度:O(N)fill:#333;important;important;fill:none;现代LLM技术RoPE相对位置编码支持长序列GQA减少KV Cache。
2026-09-07 23:07:23
274
原创 NVIDIA 为什么花 129.3 亿美元收购 Hugging Face?真正买下的不是模型,而是 AI 生态入口
为什么 NVIDIA 愿意花 129.3 亿美元收购 Hugging Face?不是因为 Hugging Face 有几个热门模型,也不是因为 NVIDIA 缺少模型。Hugging Face 掌握了 AI 开发者、模型、数据和应用之间的连接关系。而 NVIDIA 掌握的是 AI 计算基础设施。两者结合之后:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;
2026-09-06 11:15:03
221
原创 GPU 不只是跑 AI 模型:NVIDIA 如何用“决策计算“优化最后一公里?
先把问题简单化。假设有订单 A~E 和车辆 1~3,系统需要决定每辆车送哪些订单、走什么顺序:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;车辆 1订单 A订单 C订单 E车辆 2订单 B车辆 3订单 D车辆容量:车辆最大容量 1000kg,若 A=400kg、B=300kg、C=500kg,就不能全部分给同一辆车。时间窗口。
2026-09-06 10:06:22
198
原创 MIT 与 Motional 让自动驾驶“说清楚为什么刹车“:CW-Net 如何打开自动驾驶 AI 黑盒?
自动驾驶最大的挑战已经不只是"汽车能不能自己开?",而是"汽车能不能在复杂环境中稳定、安全、可预测地自己开?"而"可预测"又要求一整条链路:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;AI 理解世界AI 做出决策AI 能够解释决策人类理解 AI人类预测 AI人机安全协作CW-Net 最有价值的地方就在这里。
2026-09-03 16:37:13
617
原创 MCP 正在成为 AI 新的攻击面:当大模型开始调用工具,安全边界发生了什么变化?
让 AI 能够以标准方式使用外部工具。但也正因为如此,它把 AI + Tool + Data + Permission 连接了起来。AI 终于开始真正拥有行动能力。fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;现在LLM理解意图选择 Tool调用 MCP访问数据修改系统完成任务以前LLM回答问题。
2026-09-03 15:45:21
460
原创 Amazon Prime Air 扩张至 500 个城市
传统 AI 主要处理文字、图片、声音、代码,而 Physical AI 要解决的是真实世界的感知与行动闭环。Prime Air 可以很好地体现这一点:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;真实世界摄像头/传感器AI 感知AI 决策飞控系统无人机动作Sense → Think → Act(感知 → 思考 → 行动)。
2026-09-02 09:51:05
246
原创 Transformer与大语言模型:第14章 GPT
fill:#333;important;important;fill:none;GPT架构无Cross-Attention预训练自回归大规模文本对话能力RLHFPrompt格式生成策略Greedy。
2026-09-02 09:00:00
264
原创 Transformer与大语言模型:第13章 Decoder
fill:#333;important;important;fill:none;Decoder上三角矩阵遮住未来Token防止作弊只看当前和之前自回归生成Q来自DecoderK,V来自Encoder获取源句子信息去掉Cross-Attention只有Masked Self-Attention。
2026-08-31 23:48:52
507
原创 AI 开始自动找漏洞了:OpenAI 警告企业必须加速 AI 安全防御
攻击者和防御者都在获得新的 AI 能力。如果攻击者开始使用 AI(自动发现 + 自动分析 + 自动执行),而防御者仍然依赖(人工扫描 + 人工分析 + 人工响应),那么传统安全体系很可能逐渐无法匹配新的攻击速度。因此,企业真正应该做的事情不是简单地"禁止 AI",更合理的路线是:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;企业 AI 安全。
2026-08-31 20:43:34
448
原创 Transformer与大语言模型:第12章 BERT:Transformer Encoder 如何成为语言理解模型
BERT 是一个基于 Transformer Encoder 的预训练语言表示模型。我们需要 BERT,是因为传统的静态词向量无法很好地表示同一个词在不同上下文中的不同含义。BERT 通过双向 Self-Attention,让每个 Token 可以利用整个上下文,从而得到。这些表示可以进一步用于文本分类、NER、问答、Embedding、语义搜索,并可以进一步发展到 Embedding → Retrieval → RAG。
2026-08-31 09:00:00
249
原创 NVIDIA 与 Google 联手降低 AI 推理成本
从这篇新闻可以看到,AI 的下一阶段竞争已经不只是模型参数和 benchmark。真正决定 AI 能否规模化落地的,是一整套基础设施:模型 → 计算 → 网络 → 调度 → 安全 → 云基础设施 → 大规模部署。NVIDIA 和 Google 此次公布的方案,本质上就是围绕这条链路进行协同设计:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;
2026-08-30 21:17:05
488
原创 NVIDIA 为什么一边给 AI 公司融资,一边又卖给它们 GPU?
NVIDIA 到底是在卖 GPU,还是在参与整个 AI 基础设施?两者都是。今天的 NVIDIA 已经不再只是芯片公司,而正在逐渐成为 AI Hardware + AI Software + AI Infrastructure + AI Ecosystem + Capital 组成的综合平台。而所谓的"循环融资",恰恰把这个变化暴露得非常清楚:fill:#333;important;important;fill:none;color:#333;color:#333;
2026-08-30 10:16:18
338
原创 从 ChatGPT 到机器人:NVIDIA Jetson Orin Nano 2 背后的 Physical AI 浪潮
理解 Jetson Orin Nano 2 之前,首先要理解 Physical AI。我们可以把传统 AI 简化成:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;用户输入AI 模型输出用户比如:fill:#333;important;important;fill:none;color:#333;color:#333;
2026-08-29 09:00:00
431
原创 英伟达“循环融资”AI实验室:模式解析与行业影响
所谓“循环融资”,通常指资金在关联方之间形成闭环流动的资本安排。在英伟达的语境下,这一模式大致呈现为:英伟达向 AI 实验室投入资金,而这些实验室在采购算力时,又将大量资金以购买 GPU 芯片和服务的形式回流至英伟达。由此,投资与采购相互交织,形成一种自我强化的资金循环。这种安排并非简单的财务操作,而是深度绑定芯片供应与资本回报的战略选择。对于 AI 实验室而言,获得英伟达的投资不仅意味着资金支持,更意味着在算力紧缺时期能够优先获取高性能 GPU;
2026-08-28 20:44:30
233
原创 小鹏 Iron 人形机器人:刷新物理 AI 融资纪录的惊艳之作
本文结合公开报道,从这一融资事件出发,梳理小鹏在机器人领域的投入,并由此展望整个行业未来的走向。与此同时,大量重复性岗位可能被替代,劳动力市场将面临结构性调整,催生新的职业方向——机器人运维、AI训练师、人机协作设计师等新兴岗位将应运而生。站在这个起点上,我们既要拥抱机遇,也要以审慎的态度,为这场变革铺设好制度与伦理的轨道。它反映了资本市场对物理 AI 赛道的强烈信心——当大模型的能力从文本、图像延伸到物理世界,人形机器人被视为下一个万亿级市场的入口。如果机器人真正实现普及,其影响将是全方位的。
2026-08-28 20:40:58
195
原创 Transformer与大语言模型:第11章 Encoder 是如何理解句子的
fill:#333;important;important;fill:none;Encoder逐层理解浅层: 语法中层: 语义深层: 抽象CLS Token聚合全句信息用于分类/Embedding平均所有Token通常效果更好上下文向量同一个词不同语境向量不同。
2026-08-26 23:00:53
469
原创 Transformer 与大语言模型:第10章 Residual (残差连接)
残差连接的三个作用:fill:#333;important;important;fill:none;残差连接防止梯度消失梯度至少为 1不会连乘趋近于 0信息高速公路原始信息直接传递不会丢失解决退化问题可以学习恒等映射子层输出为 0 即可yFxxyFxx。
2026-08-26 16:36:49
444
原创 Transformer 与大语言模型:第9章 LayerNorm 归一化层
fill:#333;important;important;fill:none;归一化BatchNorm沿Batch维度适合CV不适合NLPLayerNorm沿Feature维度适合NLPBERT/GPT使用RMSNorm去掉均值更快Llama/Qwen使用。
2026-08-25 22:40:51
245
原创 Transformer 与大语言模型:第8章 Feed Forward Network(FFN 网络)
FFN = 两层全连接 + 激活函数:fill:#333;important;important;fill:none;FFN结构Activation维度先扩展再压缩激活函数ReLU 原始作用逐Token非线性变换存储事实知识。
2026-08-25 22:13:07
301
原创 Transformer 与大语言模型:第7章 Multi-Head Attention 多头注意
fill:#333;important;important;fill:none;多个Head每个Head独立计算Attention学习不同的语言特征Concat拼接所有Head的输出维度: num_heads × d_k = d_model融合不同Head的信息W_O矩阵Shape变化输入: batch,seq,d_model输出: batch,seq,d_model。
2026-08-25 08:54:02
624
原创 Transformer 与大语言模型:第6章 Self-Attention自注意
AttentionQKVSoftmaxQKTdkVAttentionQKVSoftmaxdkQKTV五步计算:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;
2026-08-24 10:26:36
522
原创 Transformer 与大语言模型:第5章 Attention 的思想
为什么需要 Attention:RNN 无法直接建立长距离依赖Attention 做什么:让每个 Token 直接和所有 Token 交互,计算相关度Q、K、V 是什么:Query 是问题,Key 是索引,Value 是内容。
2026-08-23 22:15:33
298
原创 Transformer 与大语言模型:第4章 Transformer Block
一个 Transformer Block = 4 个组件:fill:#333;important;important;fill:none;让Token互相交流全局信息聚合Residual防止梯度消失保留原始信息LayerNorm稳定训练加速收敛非线性变换维度扩展再压缩。
2026-08-23 13:10:11
305
原创 Transformer 与大语言模型:第3章 输入是如何进入 Transformer 的
important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;Token IDs例: [32, 128]例: [32, 128, 512]例: [1, 128, 512]最终输入例: [32, 128, 512]步骤输入输出作用Tokenizer文字Token ID文字→整数。
2026-08-23 11:48:13
372
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅