这项由南加州大学与耶鲁大学联合完成的研究发表于2026年的COLMConference on Language Modeling学术会议论文编号为arXiv:2607.07964有兴趣深入了解的读者可以通过该编号查询完整论文。**一、为什么要给AI减肥以及减肥有多难**当你用手机上的AI助手聊天、让它帮你写邮件或者搜索信息时你可能没意识到背后运行的大语言模型可以理解为AI的大脑体积有多么庞大。以目前主流的模型为例参数规模动辄达到几百亿甚至上千亿这些参数就像大脑里密密麻麻的神经连接存储着模型学到的一切知识。如此庞大的体积意味着什么意味着运行它们需要消耗大量的显存可以理解为AI专用的工作内存还需要极其昂贵的专业计算硬件普通电脑根本跑不动甚至连主流的商业服务器也需要同时使用多块顶级显卡才能勉强撑起。这就给AI的普及带来了严重障碍——不是每家公司都买得起那么多昂贵的硬件更别提把AI部署到手机、平板这类边缘设备上了。于是研究人员们开始思考一个问题能不能在不重新训练模型的前提下把模型压缩得更小同时尽量保留它的聪明程度这种思路在技术上叫做训练后量化Post-Training Quantization简称PTQ。如果把一个大语言模型比作一幅精细的油画那么量化就是把它转换成像素更粗的版本——原来每个细节用32位精度描述现在改用4位、3位甚至2位来描述。精度降低了图像自然会失真但如果失真控制得好远看仍然跟原画差不多。这是一场在压缩率和质量损失之间寻找最佳平衡点的博弈。现有的主流方法比如广为使用的GPTQ本质上是用一套数学工具来决定怎么压缩损失最小。但这套工具有一个根本性的局限它只盯着神经网络每一层的输入信号来做判断完全忽视了输出信号的重要性。这就好比一位厨师在调整食谱时只考虑了食材的质量却完全没想过食客的口味偏好——结果做出来的菜可能对大多数人来说还行但对某些特定需求的食客来说效果就差多了。南加州大学与耶鲁大学的研究团队注意到了这个盲点并提出了一套名为KronQ的新框架核心思路是在压缩决策中同时考虑输入侧和输出侧的信息形成真正的双向视角。**二、现有方法忽视了什么以及这个疏漏有多严重**为了理解KronQ的创新点需要先弄清楚现有方法到底在做什么、又遗漏了什么。在神经网络中每一层都可以看作一个信息处理站信息从左边流入输入经过这一层的权重矩阵可以理解为这个处理站的加工规则变换后从右边流出输出。量化的目标就是把权重矩阵里的数字精度降低同时保证输出结果不要偏差太大。衡量偏差有多大需要一把尺子。数学上这把尺子叫做海森矩阵Hessian matrix它描述了改变某个权重值对最终误差的影响有多敏感。直觉上某个权重越敏感压缩时就越需要小心对待。计算完整的海森矩阵代价极高在实际操作中几乎不可行所以研究人员通常用近似海森矩阵来代替。最常见的近似方式是用输入激活的协方差矩阵记为H_X来充当代理这正是GPTQ等方法的做法。然而根据一个叫做克罗内克分解Kronecker factorization的数学工具完整的权重海森矩阵实际上可以近似分解成两个部分的克罗内克积一部分来自输入侧就是H_X另一部分来自输出侧记为H_G由输出梯度的协方差构成。现有方法只用了H_X相当于默认另一部分H_G等于单位矩阵——也就是假设所有输出通道对误差的敏感程度完全一样。这个假设成立吗研究团队的实验结果给出了明确否定的答案。他们观察了LLaMA-2-13B模型一个130亿参数的大型语言模型中注意力机制各个投影层Q、K、V、O四个模块的H_G对角线元素值发现不同输出通道之间的敏感程度差异高达好几个数量级——有的通道对误差极度敏感有的则几乎无所谓。把它们一视同仁就像给一群体重差异悬殊的人制定完全相同的饮食方案结果自然是有人营养过剩、有人严重不足。**三、KronQ的核心思路双向视角校正**KronQ的应对策略可以用双向校正来概括具体体现在两个互补的层面上。第一个层面是双向惰性化处理BiIPBidirectional Incoherence Processing。这里的惰性化是一个专业概念背后的直觉是这样的如果权重矩阵的某些列或某些行的数值大小差异极大有的极大有的极小量化时就会非常头疼——精度预算被少数巨无霸数值占据大量普通数值反而得不到足够精细的表示。解决办法是在量化之前先对权重矩阵做一个均匀化处理让所有数值的大小变得更加均匀再量化误差自然就小得多。在KronQ之前QuIP、QuIP#等方法已经从输入侧做了这种均匀化处理具体手段是给权重矩阵左乘和右乘一些特殊的正交变换矩阵可以理解为旋转操作。但这些方法只考虑了输入侧的H_X对输出侧的H_G则完全不管。研究团队发现H_G同样高度不均匀——在LLaMA-2-7B中H_G的惰性化程度高达0.99满分1代表最不均匀表明输出侧同样存在严重的方向集中现象。因此KronQ把这种均匀化处理同时应用于输入侧和输出侧通过H_X处理列方向通过H_G处理行方向实现真正的双向均匀化。处理后的效果非常直观以Q投影层的权重矩阵为例原始状态下列方向的变异系数衡量不均匀程度的指标为0.76行方向为0.51仅做输入侧处理后列方向降到0.29但行方向几乎没变0.50双向处理之后列方向降到0.36行方向也同步降到0.34两个方向都得到了有效的均匀化。第二个层面是跨层混合精度分配。既然不同层对压缩的敏感程度不同一个自然的想法就是给敏感的层分配更高的精度更多位数给不敏感的层分配更低的精度更少位数这样在整体平均位数不变的前提下可以获得更好的效果。关键问题是怎么衡量一层的敏感程度现有方法通常用H_X的迹所有对角元素之和可以理解为矩阵的总体规模来排名。但这里有一个严重的盲点在Transformer架构的注意力模块中Q、K、V三个投影层共享完全相同的输入因此它们的H_X完全相同用H_X的迹根本无法区分这三个层的重要性只能给它们分配相同的精度预算。KronQ的解决方案是把输出侧信息也纳入敏感度评估用H_G的迹乘以H_X的迹作为综合敏感度评分。虽然Q、K、V的输入相同H_X一样但它们的输出梯度不同H_G不一样因为下游使用这三个输出的方式不同。这样KronQ就能有效区分Q、K、V的重要程度实现更精细的位数分配。**四、一个令人称奇的数学性质H_G悄悄消失了**在阐述方法的过程中研究团队证明了一个出人意料的数学结论在KronQ框架中虽然完整的量化目标包含H_G但在实际执行每一列权重的更新时H_G会从公式中代数化约消失——也就是说最终的权重补偿公式和原来的GPTAQ方法完全相同H_G不出现在任何需要重复计算的步骤里。这个性质极其关键因为它意味着KronQ在量化效果上充分利用了H_G的信息通过双向惰性化处理改善了权重分布但在计算开销上没有额外的负担——H_G只需要在预处理阶段用一次之后就可以释放掉整个量化循环的计算量与GPTAQ完全相同。用一个通俗的比喻来说H_G就像一位在赛前帮运动员热身、调整最佳状态的教练比赛开始后教练不上场但运动员的状态已经因此得到了改善。**五、实验结果最大的收益发生在最极端的压缩场景**研究团队在LLaMA-27B、13B、70B三种规模和LLaMA-38B、70B上进行了系统评测压缩精度涵盖W4每个权重4位、W33位、W22位三种设置评测指标主要是WikiText-2困惑度一种衡量语言模型质量的标准指标数值越低越好和七个常识推理基准测试的零样本准确率。在W4精度下KronQ相比GPTQ和GPTAQ的提升已经可观但仍属温和例如在LLaMA-2-7B上GPTQ的困惑度为5.82GPTAQ为5.69KronQ达到5.56优于包括SpinQuant5.58、OSTQuant5.64在内的所有对比方法。进入W3精度优势开始扩大。以LLaMA-2-13B为例GPTQ的困惑度急剧恶化到9.41GPTAQ也达到6.52而KronQ仍然保持在5.18表现相当平稳。W2精度才是真正展现差距的舞台。在LLaMA-2-7B上大多数方法在这一精度下已经严重退化GPTQ的困惑度为31.11GPTAQ直接崩溃产生无效结果NaN而KronQ达到8.15与浮点精度5.47的差距相当有限。在LLaMA-3-70B这个最具挑战性的场景下GPTQ的困惑度超过2600GPTAQ同样崩溃而KronQ以7.93的困惑度完成了有意义的2位量化——这是一个几乎令人难以置信的结果因为它意味着用平均每个参数仅2位精度就还原出了一个700亿参数模型的大部分能力。研究团队还专门分析了LLaMA-3-70B为何会让其他方法彻底失效这个模型的权重在某些输入维度上存在极端异常值变异系数高达9.21这会让量化范围被极少数巨大数值撑开导致大量普通数值的精度严重损失。仅做输入侧均匀化可以把输入方向的变异系数压到0.39但输出方向的变异系数仍有0.54加上KronQ的双向处理两个方向都降到0.29和0.24彻底消除了异常值的破坏性影响。在分组量化g128一种更精细的量化策略通常效果更好的W2设置下KronQ同样遥遥领先LLaMA-2-7B上GPTQ困惑度高达274而KronQ达到7.61LLaMA-2-13B上KronQ的6.51优于OmniQuant的8.26和GPTAQ的7.17。权重加激活联合量化W2A4即权重2位、激活4位的结果同样令人注目。在LLaMA-2-7B上GPTQ的困惑度为36.74GPTAQ降至10.91KronQ进一步降至9.38同时在七个常识推理基准上的平均准确率也从GPTAQ的46.1%提升到48.6%。研究团队还把评测范围扩展到了更新的2025年模型家族包括Gemma-3-12B、DeepSeek-R1-Distill-Llama-8B和Phi-4-mini-instruct结果在所有八个配置下KronQ均取得最低困惑度W2精度下的优势尤为突出。更重要的是在更硬核的评测基准上——GPQA-Diamond研究生级别的科学问答、MMLU大规模多任务语言理解、AIME-2024美国数学邀请赛题目、LiveCodeBench代码生成能力测试——KronQ在W4精度下也全面超越对比方法尤其是在LiveCodeBench上KronQ的得分几乎是GPTAQ的两倍说明在实际推理和代码生成等高难度任务上输出侧信息的重要性更加突出。**六、混合精度分配的精细效果**为了验证KronQ敏感度评分tr(H_G)·tr(H_X)的有效性研究团队做了一个控制实验在LLaMA-2-7B上从W2基线出发每次将最敏感的一类子层从2位升级到3位对比KronQ联合评分和传统纯输入侧评分tr(H_X)的排名差异及效果。用传统方法第一名是gate_proj升级它之后困惑度从8.15降到7.45用KronQ联合评分第一名是down_proj升级它之后困惑度从8.15降到7.22在相同平均位数2.17位下效果明显更好。更重要的是传统方法给Q、K、V三个注意力层分配了完全相同的分数因为它们共享输入根本无法区分哪个更重要而KronQ通过引入H_G使得这三个层的排名有了实质性区别。与已有的混合精度方法相比KronQ在LLaMA-2-7B上以约2.6位的平均精度就达到了W3基线整体3位方法难以企及的困惑度水平证明精准的跨层精度分配确实能把有限的位数预算用在刀刃上。**七、实用性内存节省和推理加速**除了量化质量研究团队还测量了KronQ在实际部署中的效率提升。在显存占用方面KronQ在W4精度下能把推理所需的峰值显存降低3.5到3.9倍在W2精度下甚至达到4.0到7.5倍相比bf16现在主流的16位浮点格式基线大幅缩减。最直接的部署意义是一个700亿参数的模型在bf16下需要两块80GB的A100显卡约138-141GB显存而用KronQ做W4量化后只需35-39GB可以轻松放进单块A100。在推理速度方面由于权重数据量大幅减少数据从显存传输到计算单元的时间缩短实际解码速度衡量生成每个词的时间在7B和13B模型上提升了1.25到2.51倍。在校准开销方面KronQ相比GPTAQ每层多出约8到11秒的额外时间主要来自双向哈达玛变换一种高效的正交变换实现方式的计算。内存方面在BiIP预处理阶段需要额外存储H_G矩阵一个dout×dout的矩阵但一旦预处理完成H_G就被释放后续量化循环的内存开销与GPTAQ完全一致。**八、逐项拆解每个组件的贡献**研究团队还进行了系统的消融实验即逐一去掉某个组件观察效果变化以验证每个设计选择是否真的有效。基础量化器的贡献如果把KronQ的底层量化器从GPTAQ替换成更简单的GPTQ三个模型的困惑度分别从8.15/6.99/11.92恶化到9.81/7.95/14.52说明GPTAQ的输入漂移校正机制与BiIP是相互补充的。对角缩放的贡献KronQ在做旋转变换之前先对权重矩阵做了基于H_X和H_G对角元素的缩放分别对应SX和SG两个缩放矩阵这个操作看似简单但去掉它只保留旋转变换会导致所有模型上的困惑度上升说明对角缩放是正交变换的必要前置步骤。旋转方向的贡献只做输入侧旋转H_X only可以带来明显改善只做输出侧旋转H_G only在LLaMA-2-7B/13B上严重退化困惑度高达180/81因为输入侧的异常值没有被处理反而被放大了双向结合BiIP才能稳定地获得最佳效果说明两个方向的信息确实互补缺一不可。**九、说到底这项研究意味着什么**归根结底KronQ解决的是一个视角偏颇的问题。此前的量化方法好比一位只盯着食材质量的厨师忽略了食客的口味差异KronQ则同时考虑了两端做出的菜因而更合适更多食客的口味。这个改进在日常场景中的意义非常具体它让更大、更聪明的AI模型有机会在更便宜、更普及的硬件上运行。一个原本需要两块顶级显卡才能跑的700亿参数模型经过KronQ压缩后可以在一块普通显卡上工作质量损失却小得令人满意。这对于想要本地部署AI、保护隐私、降低云服务成本的企业和研究者来说是相当实际的收益。从更宏观的视角看这项研究提醒了整个领域在神经网络的信息流中输入端和输出端本来就是不对称的过去只盯着输入端的习惯是一种历史遗留的偏见而非理论必然。KronQ提供了一个系统化的框架来纠正这种偏见未来很可能在其他需要估算网络敏感性的场景如剪枝、知识蒸馏中也找到用武之地。一个值得思考的问题是随着模型规模继续增长输出侧信息的重要性会如何变化KronQ在LLaMA-3-70B这样的超大规模模型上展现出最显著的效果某种程度上暗示答案是越大越重要。对这项研究感兴趣的读者可以通过arXiv编号2607.07964查阅完整论文相关代码也已在GitHub上公开。---QAQ1KronQ与GPTQ相比最核心的区别是什么AGPTQ在压缩神经网络权重时只考虑了输入侧的敏感度信息默认所有输出通道同等重要。KronQ则同时引入输出侧的梯度协方差矩阵H_G通过双向均匀化处理和更精准的层间精度分配让压缩决策更全面在2位和3位等极低精度下优势尤为明显。Q2KronQ的双向惰性化处理会不会显著增加推理时的计算开销A不会显著增加。KronQ在推理阶段需要对每层执行两次哈达玛变换分别对应输入侧和输出侧的旋转计算复杂度与QuIP#相同均为每层O(d·log d)量级远小于权重矩阵乘法的O(d?)实际测量中对推理延迟的影响可以忽略不计。Q3KronQ在2位量化下为什么能在LLaMA-3-70B上成功而GPTQ和GPTAQ会崩溃ALLaMA-3-70B的权重存在极端列方向异常值变异系数高达9.21这会导致GPTQ/GPTAQ的量化范围被少数超大数值撑开普通数值精度严重受损。KronQ的双向均匀化处理同时压制了列方向通过H_X和行方向通过H_G的异常值将两个方向的变异系数分别降至0.29和0.24从根本上消除了崩溃的诱因。