尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

smoothquant

smoothquant SmoothQuant是由 MIT Han Lab韩松团队于 2022 年提出的一种针对大语言模型LLM的高效无训练后量化PTQ, Post-Training Quantization技术。它的核心突破在于实现了大模型的 W8A8权重 8-bit、激活值 8-bit量化在几乎不损失模型精度甚至无损的前提下大幅降低显存占用并提升 GPU 推理吞吐。一、 核心痛点为什么 LLM 的 W8A8 量化这么难在 SmoothQuant 出现之前将大模型量化为 W8A8 一直是个难题主要原因在于激活值中的“离群值”Outliers权重的量化很容易W8权重的数值分布通常很均匀不同通道之间的极值差异不大使用常规的逐通道量化Per-channel Quantization就能无损压到 INT8。激活值的量化极困难A8LLM尤其是 6.7B 以上的模型在运行过程中某些特定通道的激活值会出现极大的异常峰值比普通数值大 100~1000 倍。如果对激活值强行做 INT8 量化这些离群值会导致大量正常数值被压缩为零被精度吃掉严重破坏模型精度。硬件限制为了消除离群值的影响理论上可以对激活值也采用逐通道量化但GPU 硬件如 Tensor Core的矩阵乘法单元GEMM不支持激活值按通道缩放与权重的混合计算。硬件友好型计算要求激活值必须是逐张量Per-tensor或逐 TokenPer-token量化的。二、 核心原理等价数学变换迁移难度SmoothQuant 的根本创新在于利用数学上的等价变换将“激活值”中的量化难度“迁移”一部分给“权重”。矩阵乘法基本公式YX⋅WY X \cdot WYX⋅WSmoothQuant 在XXX激活值和WWW权重之间插入了一个对角缩放矩阵Sdiag(s)S \text{diag}(s)Sdiag(s)Y(X⋅S−1)⋅(S⋅W)X^⋅W^Y (X \cdot S^{-1}) \cdot (S \cdot W) \hat{X} \cdot \hat{W}Y(X⋅S−1)⋅(S⋅W)X^⋅W^对激活值XXX除以平滑因子sssX^X⋅S−1\hat{X} X \cdot S^{-1}X^X⋅S−1将激活值中的离群峰值压平/平滑化。对权重WWW乘以平滑因子sssW^S⋅W\hat{W} S \cdot WW^S⋅W让权重吸收这些离群量。为什么权重可以吸收这个难度因为权重是逐通道Per-channel量化的即使乘以sss之后某些通道的权重变大了逐通道量化也会为每个通道分配独立的量化比例尺Scale因此权重依然能被无损地量化为 INT8。三、 平滑因子sss的计算方式控制权衡参数γ\gammaγ为了平衡激活值和权重的量化难度SmoothQuant 引入了一个超参数γ∈[0,1]\gamma \in [0, 1]γ∈[0,1]sjmax⁡(∣Xj∣)γmax⁡(∣Wj∣)1−γs_j \frac{\max(\vert{}X_j\vert{})^\gamma}{\max(\vert{}W_j\vert{})^{1-\gamma}}sj​max(∣Wj​∣)1−γmax(∣Xj​∣)γ​其中sjs_jsj​表示第jjj个通道的平滑因子XjX_jXj​和WjW_jWj​分别是该通道上激活值和权重的绝对值最大值。γ1\gamma 1γ1将激活值的离群难度完全转移给权重激活值变得极平滑但权重可能变得难量化。γ0\gamma 0γ0完全不转移退化为普通量化。γ0.5\gamma 0.5γ0.5默认推荐值激活值和权重平摊量化难度此时激活值和权重的最大值被调整到了相同的数量级达到最佳的精度平衡。四、 SmoothQuant 的完整执行流程校准Calibration使用少量样本如 512 个 Token跑一遍模型统计每个激活通道的最大绝对值max⁡(∣Xj∣)\max(\vert{}X_j\vert{})max(∣Xj​∣)。计算sss并重置权重根据公式计算出每个通道的sjs_jsj​直接将权重更新为W^S⋅W\hat{W} S \cdot WW^S⋅W这一步在推理前离线完成运行时零额外开销。运行时平滑Online Smoothing推理过程中在前馈网络如 Linear / GEMM输入前将激活值除以sssX^X⋅S−1\hat{X} X \cdot S^{-1}X^X⋅S−1。由于SSS是逐通道标量这一步可以融合进前一个算子如 LayerNorm / RMSNorm中不增加额外内存访问。标准 INT8 GEMM 计算将平滑后的X^\hat{X}X^Per-tensor/Per-token 量化与W^\hat{W}W^Per-channel 量化喂给硬件 Tensor Core 执行标准的 INT8 矩阵乘法。五、 核心优势与行业影响完美匹配硬件生成的X^\hat{X}X^和W^\hat{W}W^完全符合现有 GPU如 NVIDIA Ampere/Hopper/BlackwellINT8 Tensor Core 的计算模式。零/极低精度损失在 OPT-175B、BLOOM-176B、LLaMA 系列等数百亿甚至上千亿参数模型上W8A8 量化后的准确率与 FP16 几乎一致。显存与吞吐双重收益显存占用减半权重从 FP16 的 2 字节降至 1 字节。推理吞吐提升 1.5x - 2x密集 GEMM 计算受限于带宽和算力INT8 计算吞吐远高于 FP16。生态工业标准SmoothQuant 目前已被广泛集成到主流的大模型推理加速引擎中包括TensorRT-LLM、vLLM、LMDeploy、DeepSpeed-Inference等。
返回列表