大模型量化（一）为什么大模型需要量化？量化是如何工作的？

大模型面试

已于 2024-09-11 20:11:07 修改

阅读量3.9k

点赞数 21

文章标签：人工智能大模型 AI大模型大模型量化大模型开发 LLM 学习

于 2024-09-11 06:00:00 首次发布

本文链接：https://blog.csdn.net/Code1994/article/details/142108874

版权

一、什么是量化，为什么需要它？

量化是一种将较大尺寸的模型（如 LLM 或任何深度学习模型）压缩为较小尺寸的方法。量化主要涉及对模型的权重参数和激活值进行量化。让我们通过一个简单的模型大小计算来验证这个说法。

在这里插入图片描述

左侧：基础模型大小计算（单位：GB），右侧：量化后的模型大小计算（单位：GB）

在上图中，**基础模型 Llama 3 8B 的大小为 32 GB。经过 Int8 量化后，大小减少到 8GB（减少了 75%）。使用 Int4 量化后，大小进一步减少到 4GB（减少约 90%）。**这使模型大小大幅减少。

这么算，7B的大模型FP16部署权重14G，INT8是8G，INT4再砍半是4G

量化两大作用：

降低显存需要
提升推理性能

不仅有助于在有限硬件资源上部署更大的模型，还能加快模型的推理速度，对精度的折损还比较OK，不用白不用。

二、量化是如何工作的？简单的数学推导

从技术上讲，量化将模型的权重值从较高精度（如 FP32）映射到较低精度（如 FP16、BF16、INT8）。虽然有许多量化方法可供选择，但在本文中，我们将学习其中一种广泛使用的量化方法，称为线性量化方法。线性量化有两种模式：A. 非对称量化和B. 对称量化。我们将逐一学习这两种方法。

A. 非对称线性量化： 非对称量化方法将原始张量范围（Wmin, Wmax）中的值映射到量化张量范围（Qmin, Qmax）中的值。

Wmin, Wmax： 原始张量的最小值和最大值（数据类型：FP32，32 位浮点）。在大多数现代 LLM 中，权重张量的默认数据类型是 FP32。
Qmin, Qmax： 量化张量的最小值和最大值（数据类型：INT8，8 位整数）。我们也可以选择其他数据类型，如 INT4、INT8、FP16 和 BF16 来进行量化。我们将在示例中使用 INT8。
缩放值（S）： 在量化过程中，缩放值将原始张量的值缩小以获得量化后的张量。在反量化过程中，它将量化后的张量值放大以获得反量化值。缩放值的数据类型与原始张量相同，为 FP32。
零点（Z）： 零点是量化张量范围中的一个非零值，它直接映射到原始张量范围中的值 0。零点的数据类型为 INT8，因为它位于量化张量范围内。
量化： 图中的“A”部分展示了量化过程，即 [Wmin, Wmax] -> [Qmin, Qmax] 的映射。
反量化： 图中的“B”部分展示了反量化过程，即 [Qmin, Qmax] -> [Wmin, Wmax] 的映射。

那么，我们如何从原始张量值导出量化后的张量值呢？ 这其实很简单。如果你还记得高中数学，你可以很容易理解下面的推导过程。让我们一步步来（建议在推导公式时参考上面的图表，以便更清晰地理解）。

细节1：如果Z值超出范围怎么办？解决方案：使用简单的if-else逻辑将Z值调整为Qmin，如果Z值小于Qmin；若Z值大于Qmax，则调整为Qmax。这个方法在图4的图A中有详细描述。

细节2：如果Q值超出范围怎么办？解决方案：在PyTorch中，有一个名为 clamp 的函数，它可以将值调整到特定范围内（在我们的示例中为-128到127）。因此，clamp函数会将Q值调整为Qmin如果它低于Qmin，将Q值调整为Qmax如果它高于Qmax。

量化张量值的范围为-128到127（INT8，带符号整数数据类型）。如果量化张量值的数据类型为UINT8（无符号整数），则范围为0到255。

B. 对称线性量化： 在对称方法中，原始张量范围内的零点映射到量化张量范围内的零点。因此，这被称为对称量化。由于零在两侧范围内均映射为零，对称量化中不存在零点（Z）。整体映射发生在原始张量范围的 (-Wmax, Wmax) 和量化张量范围的 (-Qmax, Qmax) 之间。下图展示了量化和反量化情况下的对称映射。