
第一部分基本收录情况项目内容论文全名QVLA: Not All Channels Are Equal in Vision-Language-Action Models Quantization中文译名《QVLA视觉-语言-动作模型量化中并非所有通道都同等重要》正式收录ICLR 2026会议全称International Conference on Learning Representations论文状态正式 Conference Paper / PosterICLR展示时间2026年4月23日作者Yuhao Xu、Yantai Yang、Zhenyang Fan、Yufan Liu、Yuming Li、Bing Li、Zhipeng Zhang主要机构上海交通大学、中科院自动化所、中国科学院大学、蚂蚁集团等研究方向VLA、模型量化、模型压缩、机器人部署主要基座OpenVLA、OpenVLA-OFT附录扩展至 UniVLA核心BenchmarkLIBERO另有 CALVIN 和真实机器人实验方法类型Action-centric Channel-wise Mixed-Precision Quantization是否训练新VLA不是主要对已有VLA进行压缩是否开源论文给出 QVLA GitHub 项目第二部分解决的问题π0→π0.5→FAST→OpenVLA-OFT→RDT-1B→GR00T N1→SmolVLA到这里你已经知道如何解决大规模机器人数据VLM/VLA架构diffusion / flow matchingaction chunkFAST动作token跨具身小型VLA高效推理。而 QVLA 接着问模型结构不改变的情况下能不能把7B VLA的权重从16 bit压到8 bit、4 bit甚至部分0 bit但机器人仍然能正常工作所以SmolVLA从架构上把VLA做小而QVLA从数值精度上把已有VLA压小第三部分QVLA 基本信息QVLA 不是重新设计一个新的 Vision-Language-Action 基础模型而是面向已有 VLA 的模型压缩与部署方法。以 OpenVLA 为例原模型通常采用 BF16/FP16 权重而 QVLA 会根据不同 Channel 对最终机器人 Action 的敏感程度为其分配不同精度其中 0-bit 表示直接剪枝因此 QVLA 实际上将量化与剪枝统一到同一个逐通道精度分配框架中。论文将其定义为一种Action-Centric、Channel-wise Quantization以动作为中心的通道级量化方法。之所以需要这种方法是因为 OpenVLA 等 7B 级 VLA 在半精度下显存占用可超过 14 GB在资源受限机器人平台上还会产生较大的推理延迟。虽然将 16-bit 权重压缩到 8-bit 或 4-bit 可以显著减少模型存储和计算开销但传统 LLM/MLLM 量化主要关注权重、Feature 或文本误差并不能保证机器人最终 Action 仍然准确。VLA 中微小的量化误差会直接改变动作并可能在闭环控制和长时程任务中持续累积因此不能简单照搬统一低比特量化。“通道级量化Channel-wise Quantization”最简单理解就是不是整层神经网络统一用一个 bit而是把这一层里面的不同通道分别处理每个通道可以用不同的量化精度。第四部分为什么量化要直接关注 Action Error传统 LLM/MLLM 量化通常通过文本困惑度、内部特征重构误差或视觉特征保真度判断量化质量但这些指标并不能直接反映机器人控制是否仍然正确。VLA 输出的是实际执行的 Action在闭环控制中即使单步量化只产生很小的动作偏差执行后也会改变下一时刻的环境状态随后模型又会基于已经发生偏移的状态继续预测因此误差可能沿时间不断累积最后可能导致抓偏手爪提前松开轨迹偏移接触失败长时序任务彻底失败。论文因此指出VLA 的量化质量不能只由中间 Feature 是否接近原模型来判断而应直接衡量量化对最终 Action 的影响。也就是量化好不好不应该只看feature误差而应该看action误差。第五部分量化的基本概念模型通常以 BF16/FP16 等浮点格式存储权重。量化的核心是将高精度浮点参数映射到较低 bit 的整数表示例如将 16-bit 权重压缩为 8-bit 或 4-bit从而减少模型存储和推理开销。对于权重其量化过程可以写为推理时再通过缩放因子得到近似权重然后需要计算时恢复近似值因此量化后的参数只能近似原始权重但肯定产生也就是量化误差。常见的W8A8 Weight 8bit Activation 8bitW4A4 Weight 4bit Activation 4bitW8A16 Weight 8bit Activation 16bitW4A16 Weight 4bit Activation 16bit。例如一层这里而训练阶段Weight不断更新Activation不断产生推理阶段Weight固定Activation仍然动态产生论文就是研究对于普通模型量化通常关注如何减小这种数值误差而 QVLA 进一步提出VLA 真正需要关心的不是 ΔW 本身有多小而是这种参数误差最终会让机器人 Action 偏多少怎样让这些量化误差尽可能不要影响最终机器人动作。第六部分论文中的2大发现1发现1不同 VLA 模块的量化敏感性QVLA 首先将 VLA 划分为 Vision Encoder、Projector、Language Module 和 Action Head并分别量化各模块观察最终 Action Error 的变化。实验发现Vision Encoder 对量化相对鲁棒Language Module 更敏感而 Projector 和 Action Head 的敏感度最高。其中 Projector 负责将视觉特征映射到视觉语言共享表示空间一旦量化误差破坏跨模态对齐就会进一步影响后续动作生成Action Head 则直接将模型表示转换为机器人动作因此其量化误差几乎会直接传递到最终 Action。因此 Figure 1(a) 得出的核心结论就是VLA 的不同模块不能采用完全相同的量化强度尤其需要保护对最终 Action 高度敏感的 Projector 和 Action Head。2发现2同一层内部的 Channel 也不一样Figure 1(b) 进一步将分析粒度从module降到channel。实验表明即使位于同一模块、同一层内部不同 output channel 在量化后造成的Action Error也可能相差多个数量级。这说明 VLA 并不适合采用“整层统一 4-bit”或“整模型统一 4-bit”这类粗粒度量化策略而应根据各个 channel 对最终机器人动作的影响分配不同精度。也正因此QVLA 采用channel-wise mixed-precision quantization重要 channel 保留较高 bit不敏感 channel 使用更低 bit极不重要的 channel 甚至可设为0-bit即直接剪枝。Figure 1(b) 因而正是论文标题“Not All Channels Are Equal”的直接实验依据。层级关系例如 Vision Encoder 内部实际是每一层又有很多 Channel然后 Figure 1(b) 做的事情相当于把这些 Channel 全部连续排起来最后得到横轴Global channel index (aggregated)所以Vision Encoder、Projector、Language Module、Action Head这些大区域 Module横轴上的每一个细小位置 一个 ChannelLayer 本身没有明确标出来第七部分QVLA核心内容1QVLA 的整体量化流程Figure 2 展示了 QVLA 从全精度 VLA 到低比特模型的完整流程核心只有两个步骤。第一步是 Action-space Sensitivity Analysis对每个 Channel分别测试其量化到bit 后产生的最终 Action Error从而得到不同 Channel、不同 bit-width 对机器人动作的敏感度并构成Sensitivity Matrix。第二步是 全局比特分配Global Bit Allocation根据 Action Sensitivity从全精度开始优先降低低敏感 Channel 的精度按照逐级进行 Greedy Demotion贪心式比特降级算法直到满足目标平均 bit budget其中0-bit 表示直接剪枝该 Channel因此 QVLA 在同一框架中统一了混合精度量化与 Channel Pruning 通道剪枝。即Step 1判断每个channel有多重要Step 2按照重要程度分配不同bit对应流程就是已经训练好的 VLA→少量校准数据 Calibration Data→分析每个 Channel 的 Action Sensitivity→分配 0/2/4/8/16 bit→得到量化后的 VLA然后真正部署时就是直接拿这个Quantized VLA去正常推理RGB Language→Quantized VLA→ActionFigure 2给出了QVLA从全精度VLA到最终量化模型的完整流程。首先以Llama 2 7B、ViT和Projector组成的Base VLA为基础在Step 1中依次选定某个Channel c 和候选bit-width b∈{0,2,4,8,16}只量化该Channel然后比较量化模型与全精度模型产生的机器人Action从而得到该Channel在不同bit-width下的Action Error并最终构成完整的Sensitivity Matrix。随后对所有Channel按照Action-space Sensitivity排序在Step 2中从全精度权重开始通过Greedy Demotion逐渐将低敏感Channel从16-bit降至8-bit、4-bit、2-bit乃至0-bit直到满足目标平均bit预算。这里的0-bit直接表示Pruning因此QVLA实际上在同一个Channel-wise bit allocation框架中统一实现了量化和剪枝。2Action-space Sensitivity——直接衡量量化对机器人动作的影响QVLA 不再用权重误差或 Feature Error 判断某个 Channel 是否重要而是直接测量将第层第个 Channel 量化到bit 后最终机器人 Action 改变了多少。设全精度模型输出为仅量化该 Channel 后的输出为则单步 Action-space Sensitivity 定义为其中因此越小说明该 Channel在当前 bit-width 下对最终动作越不敏感可以进一步降低精度反之Sensitivity 越大则需要保留较高 bit。这里需要强调它不是简单判断“这个 Channel 重不重要”而是判断这个 Channel 压到 b bit 后Action 会偏多少3为什么还需要累计Sensitivity机器人是闭环控制系统单步很小的 Action Error 也可能改变下一时刻状态并进一步影响后续动作比如单步动作误差可能很小但连续执行100步误差会累积。因此 QVLA 又定义整个轨迹上的累计敏感度它衡量的不再只是“当前一步动作偏了多少”而是量化这个 Channel 后执行完整一段机器人轨迹时累计产生了多少 Action Error。论文指出累计 Sensitivity 与最终任务成功率具有更强的相关性因为它能够反映长时程控制中的误差累积。Figure 3正是这一现象的直观验证随着执行 timestep 增加量化模型的 Cumulative MSE 持续上升而且低 bit 的误差累积更加明显相比普通统一量化QVLA 的 action-aware 分配能够降低累计误差。它说明机器人量化不能只看一次前向计算产生了多少误差还必须考虑这些误差在闭环执行过程中是否会不断放大。4如何高效估计 Channel 的 Action Sensitivity原本我们真正想知道的是第层第个 Channel 如果量化成bit最终 Action 会偏多少也就是最直接的做法当然是量化 Channel→跑模型/环境→得到新 Action→和原 Action 比较如果严格计算每个 Channel 的敏感度需要对第层第个 Channel 分别尝试并比较量化前后的 Action。由于 VLA 包含大量 Channel逐一精确评估成本很高因此 QVLA 使用一阶 Taylor 近似快速估计量化扰动对最终 Action 的影响。设量化使该 Channel 的输出发生变化则利用一阶Taylor展开最终 Action 的变化可近似为其中①第一部分量化后这个 Channel 自己被扰动了多少比如一个 Channel 从 BF16 压成 4-bit 后它原本的输出是量化后的近似输出是因此我们得到然后统计这种量化噪声的方差这个东西不需要机器人跑起来。只需要 Calibration Data 输入模型然后在模型内部看看“这个 Channel 压成 4-bit 后它自己的数值改变了多少”②第二部分这个 Channel 一旦变化最终 Action 有多敏感计算雅可比矩阵衡量的就是Channel稍微变化一点最终 Action 会跟着变化多大这个也不需要真的执行机器人动作而可以通过模型的梯度/反向传播得到。比如很大意味着这个 Channel 稍微动一下Action 就变化很明显 → 很敏感。反之很小这个 Channel 变化一点Action 几乎不受影响 → 不敏感。③汇总二者论文用一阶 Taylor 展开把最终 Action 的变化近似成 Channel 扰动乘以 Action 对该 Channel 的近似敏感度这个公式非常直观它实际上由两部分决定Sensitivity≈量化噪声大小×该 Channel 对 Action 的影响程度大小也就是说一个 Channel 即使量化误差较大如果最终 Action 对它并不敏感仍然可以压低 bit反过来即使量化扰动不大但该 Channel 对 Action 极其敏感也应该保留较高精度。论文利用这一近似提高 Channel Sensitivity 的估计效率再据此进行后续的 bit allocation。5Bit Allocation——在固定预算下如何分配精度在得到每个 Channel 在不同 bit-width 下的 Action Sensitivity 后QVLA 将量化转化为一个约束优化问题。对于第层第个 Channel分配目标是在满足平均 bit 预算的条件下使所有 Channel 引起的总 Action Error 最小满足其中这个channel分多少bitchannel总数允许的平均bit预算。也就是说并不代表所有 Channel 都必须使用 8-bit而是允许不同 Channel 采用不同精度只要整体平均不超过 8-bit例如可以出现16,16,8,8,4,4,2,0 平均满足预算即可。6Greedy Demotion贪心式比特降级算法QVLA究竟怎么分配bit直接求解所有 Channel 的最优 bit 组合成本很高因此 QVLA 采用Greedy Demotion。所有 Channel 初始均设为 16-bit并只允许按相邻精度逐级下降对于某个 Channel 从高精度降到低精度定义其中表示每节省 1 bit 所增加的 Action Sensitivity因此越小说明降低这个 Channel 的精度可以节省 bit但对 Action 的影响较小应优先降级。算法每次选择当前最小的操作例如将某个 Channel 从 16→8完成后再把该 Channel 下一步 8→4 的候选操作加入比较持续执行直到满足目标平均 bit 预算。0-bit 表示直接剪枝该 Channel。QVLA 不问“哪个 Channel 最不重要”而是不断问“现在再省下一些 bit降哪个 Channel 最划算”最终就可能形成从而在满足平均 bit budget 的同时尽量减少 Action Error。算法使用最小堆维护候选降级操作整体复杂度约为其中是channel数。7VLA 的实际量化策略QVLA 在 bit allocation 中允许每个 Channel 选择其中0-bit 表示直接剪枝该 Channel。因此QVLA 将传统上相互独立的 Quantization 和 Pruning 统一到同一个 Channel-wise Bit Allocation 框架中也就是说随着 Channel 对最终 Action 的敏感度降低它既可以被逐步降低数值精度也可以最终被直接移除。但实际部署时QVLA 并不是让所有计算都采用任意混合 bit。为了提高真实硬件上的执行效率QVLA 只对 Weight 采用逐 Channel 混合精度而 Activation 在整个模型中保持统一 bit-width从而避免推理过程中频繁切换不同精度计算路径以及将矩阵运算拆成大量不同精度的小型 Kernel。Weight Quantization把训练完成后已经固定的模型权重从 BF16 压成 8-bit、4-bit 等主要减少模型权重显存。Activation Quantization在模型推理过程中把每一层动态产生的中间 Activation 也用 8-bit、4-bit 等较低精度表示和计算从而进一步降低运行时显存和计算成本。此外论文最终只对Vision Backbone 和 Language Module进行量化而对量化最敏感的 Projector 和 Action Head 保持 BF16以保护跨模态映射和机器人控制稳定性。Vision backbone量化Language module量化Projector保持BF16Action Head保持BF16。第八部分实验效果1实验设置QVLA 主要在LIBERO基准上进行评估覆盖 Spatial、Object、Goal 和 Long 四类任务并以OpenVLA和OpenVLA-OFT作为主要 VLA 基座与 SmoothQuant、OmniQuant、AWQ 等传统量化方法进行对比。全精度模型采用 BF16校准数据从 LIBERO 训练 demonstrations 中采样并通过短程环境 rollout 对 Channel Sensitivity 的排序进行验证。主实验在 RTX 4090 上完成重点比较不同量化方法在任务成功率、显存占用和推理速度之间的权衡。2Weight Activation 联合量化结果Table 1 比较了 OpenVLA 和 OpenVLA-OFT 在 W8A8、W4A4 条件下采用 SmoothQuant、OmniQuant 和 QVLA 后的性能。QVLA 在更激进的W4A4下仍能较好保持原模型能力OpenVLA 从全精度的76.5%降至76.0%仅下降 0.5 个百分点同时显存由15.2 GB 降至 4.3 GB并获得1.47×推理加速相比之下SmoothQuant 和 OmniQuant 分别下降至 63.2% 和 73.3%。在更强的 OpenVLA-OFT 上这一优势更加明显全精度模型平均成功率为97.1%QVLA W4A4 仍达到96.0%显存由15.4 GB 降至 4.5 GB约为原来的29.2%同时实现1.49×加速而 SmoothQuant 在同一设置下只有 73.4%。因此QVLA 的关键优势不是单纯“降低 bit”而是通过Action-aware Channel-wise Bit Allocation将有限的精度优先保留给真正影响机器人动作的 Channel。核心就是OpenVLA-OFT15.4 GB→QVLA W4A44.5 GB同时97.1%→96.0%,Speedup1.49×也就是论文摘要强调的只使用约 29.2% 的原始显存同时保持约 98.9% 的原始性能3Weight-only 量化结果Table 2 进一步只量化 Weight并保持 Activation 为 16-bit用于验证 QVLA 的优势是否依赖于 Weight 和 Activation 同时量化。结果表明在 OpenVLA 的W4A16设置下QVLA 仍保持76.5%的平均成功率与全精度模型完全持平同时显存从 15.2 GB 降至4.3 GB而 AWQ 仅为 70.8%。OpenVLA-OFT 上也呈现相同趋势QVLA W4A16 达到96.7%仅比全精度的 97.1% 下降 0.4 个百分点而 AWQ 为 92.5%。因此 Table 2 进一步说明QVLA 的优势并不依赖于 Weight–Activation 联合量化即使只压缩 Weight其 Action-Centric Channel-wise 分配策略仍能在显著降低显存的同时基本保持原始 VLA 性能。4关键消融实验① Channel-wise 是否真的优于 Layer-wiseTable 3 直接验证 QVLA 最核心的设计——Channel-wise Quantization。以 OpenVLA 全精度的 76.5% 为基准INT4 下 Layer-wise 量化仅达到 74.8%而 Channel-wise 恢复到76.5%INT8 下 Layer-wise 为 74.9%Channel-wise 则达到76.8%。这说明即使平均量化精度相近将 bit 预算细化到不同 Channel 仍能更好地保护最终 Action直接支持了论文的核心判断Not All Channels Are Equal。② Mixed Precision 和 0-bit Pruning剪枝 是否真的有用Table 4 在相同的整体 INT8 bit budget 下进一步拆解了Mixed Precision与0-bit Pruning的作用。只采用 Channel-wise Mixed Precision、但不允许 0-bit 时平均成功率为76.7%、显存 7.5 GB进一步加入 0-bit Pruning 后达到76.8%显存降至7.0 GB。相比之下统一 8-bit 只有 74.6%即使加入 Pruning 也仅为 74.7%。Pruning 必须建立在正确的 Action-aware Channel Selection 上QVLA 的优势来自 Channel-wise Mixed Precision 与 0-bit Pruning 的联合设计而不是简单删除部分参数。论文也明确把 0-bit 定义为 pruning并将其纳入同一个逐 Channel bit allocation 框架。③ 为什么需要考虑长时程 Action ErrorFigure 3 用累计 MSE 展示了量化误差随机器人执行时间不断积累的现象。随着 timestep 增加4-bit 和普通 8-bit 的累计 Action Error 持续增大而 QVLA 的 Action-aware 8-bit 方案增长更慢。这说明 VLA 量化不能只关注单次前向计算产生的误差因为微小 Action 偏差会在后续闭环控制中不断传播这也是论文进一步定义Cumulative Sensitivity的实验依据。论文指出累计敏感度与最终任务成功率的相关性比单步误差更强。5真实机器人部署实验Figure 4 展示了真实机器人实验平台由两台 IMETA-Y1 机械臂和三台 Orbbec DaBai DCW2 相机组成并设置单臂 Pick white pen、Pick potato chips 以及双臂 Fold towels 三类任务。Table 5 则比较原始 π0 与 W8A16 量化后的 AutoQVLA。原始 π0 三项任务平均成功率为63.3%AutoQVLA 量化后仍为63.3%同时推理速度提升至1.28×。单个任务存在少量波动但每项只有 10 次测试因此更可靠的结论是QVLA 在真实机器人上基本保持原始控制成功率同时获得约 28% 的推理加速说明其量化策略不仅在仿真 Benchmark 中有效也具有真实硬件部署价值。第九部分创新点和不足1核心创新1. Action-Centric Sensitivity面向动作的敏感度:传统量化通常先看“量化以后模型内部的数值和原来差了多少”QVLA则更关心“这些数值变化最终有没有把机器人动作带偏”。同时进一步考虑长时程控制中的误差累积用累计 Action Sensitivity 描述量化扰动对整个执行过程的影响。2. Channel-wise Mixed-Precision Bit Allocation逐通道混合精度比特分配:QVLA 将量化粒度从整模型或整层细化到 output channel根据不同 Channel 的 Action Sensitivity 分配 16/8/4/2-bit并通过 Greedy Demotion 在给定平均 bit budget 下优先降低低敏感 Channel 的精度。论文的实验也证明 Channel-wise 明显优于 Layer-wise。3. Quantization 与 Pruning 统一量化与剪枝统一:QVLA 将候选精度扩展为b∈{0,2,4,8,16},其中0-bit 直接表示 Pruning因此“降低参数精度”和“删除低敏感 Channel”被统一到同一个 bit allocation 框架中。2局限性1. 尚未实现真正的全模块低比特量化。虽然 QVLA 对各模块都进行了敏感度分析但实际主要量化 Vision Backbone 和 Language Module最敏感的Projector 与 Action Head 仍保持 BF16。因此论文证明的是“关键模块选择性低比特量化有效”而不是整个 VLA 都能安全压到 4-bit。2. Bit Allocation 仍未完全自动化。当前精度分配中的 gate ratio 仍包含启发式选择论文明确将“根据给定 bit budget 自动确定最佳 gate ratio”列为未来工作因此当前方案仍存在一定人工调参成本。3QVLA → QuantVLAQVLA 已经证明 VLA 不能照搬 LLM 的统一量化策略并通过 Action-space Sensitivity 实现逐 Channel 混合精度量化但其主体实验仍主要针对 OpenVLA 系列自回归生成token实际量化中还将敏感的 Action Head 保持为 BF16因此尚未系统解决现代“Language Backbone DiT Action Head”架构中动作生成模块的低比特问题。QuantVLA 则进一步面向 π0.5、GR00T N1.5 等 DiT-based VLA研究如何同时压缩 Language Backbone 与 DiT Action Path并抑制量化引起的跨模块数值漂移。因此QuantVLA 将研究重点进一步从“哪些 Channel 可以压低 bit”推进到“如何让 Language Backbone 与 DiT Action Head 在低 bit 下仍保持正确的数值尺度和稳定的动作生成”为此QuantVLA采用Selective Quantization Attention Temperature MatchingATM Output Head BalancingOHB在保持原始模型架构和无需重新训练的情况下对 Language Backbone 和 DiT Action Path 进行联合低比特部署。