
你有没有遇到过这样的辅导老师他站在你身后指着题目说这里应该填B语气笃定你也就跟着写了B。但你从没搞清楚他为什么觉得是B。是因为他看穿了题目里那个你没注意到的细节还是因为他自己也不太确定只是习惯性地这么说话这个问题放在人工智能领域变成了一个非常具体又棘手的技术难题。现在的多模态大模型就是那种既能看图又能说话的AI经常会栽在一些小事上。比如一张图里写着striped条纹这个单词模型却认成了checkered格子后面一整段推理都建立在这个错误认知上说得头头是道但地基歪了。研究者们想到一个办法找一个更强的老师模型让它看到学生模型看不到的信息比如把图片里关键区域放大特写然后拿老师的判断去纠正学生。这个思路叫做**在策略蒸馏**On-Policy Distillation简称OPD意思是让老师针对学生自己生成的答案进行批改而不是脱离实际地给标准答案配合特权视角老师看到了学生看不到的放大细节听起来天衣无缝。但这篇来自上海交通大学、小红书等机构联合发布的论文《VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation》指出这套流程里藏着一个被长期忽视的漏洞**老师的每一次纠正到底是因为看清了图还是因为别的原因**老师的批改里到底有多少是真材实料我们先把这个问题讲得更具体一点。研究者设计了一个诊断实验。他们让一个4B参数规模和一个9B参数规模的模型这里的B指十亿4B就是40亿参数各自生成回答然后在每一个生成的字词位置都去问那个特权老师你觉得这里该改成什么同时也去问如果把关键的视觉证据挡住你还会这么改吗结果发现在老师给出的、修改幅度最大的那批纠正意见里只有23.2%4B模型和22.8%9B模型真的和看没看到证据这件事强相关。也就是说将近八成的强烈纠正跟视觉证据本身的关系并不大。它们可能来自老师这个模型本身的语言习惯也可能来自训练数据留下的某种偏好但唯独不完全是我看清楚了图所以我改。这就是论文提出的核心概念**信号源混杂**source-mixed指老师的纠正信号里混合了视觉证据、语言先验和老师模型自身特性三者叠在一起分不清楚。如果不把这三种成分拆开直接把老师的完整判断塞给学生模仿会发生什么打个比方。你请了一位口音很重、习惯用某些口头禅的家教来批改作文。他划掉你的一句话写上这里应该这样写。这个修改里可能确实是因为你的表达有逻辑漏洞但也可能夹杂着他个人的写作癖好甚至是他自己也没意识到的口头禅式替换。如果你把他的每一次修改都原封不动照抄你学到的不只是逻辑更严谨还有一堆和逻辑无关的、纯粹是他个人风格的东西。长期这样训练下去你的作文会越来越像他但不一定越来越对。如果不做这个区分直接全盘照搬老师的修改模型学到的就是这样一锅大杂烩有用的信号和无关的噪声混在一起训练效率自然大打折扣。已有的补救方案为什么打分不够用在VAD这篇论文之前已经有研究者注意到这个问题并且提出了改进方案但论文认为这些方案都只解决了怎么改改多少没有解决改的内容对不对。第一种思路叫**Vision-OPD**做法是让老师看放大后的关键区域照片然后直接把老师的完整判断当作训练目标去让学生模仿。这就是前面说的那种全盘照抄策略问题已经分析过了。第二种思路更聪明一点叫**VA-OPD**Visual-Advantage OPD视觉优势加权蒸馏。它的做法是给每个字词打一个视觉优势分让老师分别看清晰版和模糊版的图如果看清晰版时某个词的概率明显更高说明这个词很依赖视觉证据值得重点学习。这个思路听起来很合理但论文里举了一个具体的例子揭示了它的一个死角。假设题目问的是帽子的图案是什么正确答案是B选项条纹学生却选了D选项格子。当老师看模糊图时格子这个答案的概率是94.6%几乎是老师蒙对的置信度。而当老师看清晰图后条纹的概率跃升到95.0%格子的概率骤降到2.0%。按照VA-OPD的打分规则视觉优势分只统计证据出现后概率提升了多少是一个只算正向增益、不算负向惩罚的**校正后的对数概率变化**简单说就是看清楚证据之后某个答案变得更可能还是更不可能。学生选错的那个格子答案它的概率是从94.6%掉到2.0%是被证据狠狠打脸的但因为VA-OPD的打分只往正方向看这种被证据推翻的信息反而被忽略了格子这个词根本没被标记为高视觉相关性。这就好比你考试蒙对了一道选择题蒙的时候心里其实很虚后来看到正确解析才发现自己蒙错了本来该选另一个。如果一个评分系统只关心哪些答案因为看了解析而变得更有把握却完全不关心哪些答案被解析证明是错的那这套系统就漏掉了一半最重要的信息就是那些证据明确否定错误答案的时刻。如果VA-OPD不去处理这种负向证据会有什么后果学生的错误认知得不到明确的反向修正信号只是在正确答案的可能性上被略微加权纠错力度会打折扣。VAD的解法把老师的话拆开重新组装一份看得懂的教材搞清楚问题出在哪之后研究者提出了这篇论文的核心方法**VAD**Visual Attribution Distillation视觉归因蒸馏。VAD的基本思路可以概括成一句话不是直接把老师的判断塞给学生而是先搞清楚老师这次判断里有多少是真的因为看见了然后只把这部分看见了才改的内容重新组装成一份新的学习目标。具体怎么做第一步构造对照实验。VAD在训练时让同一个老师模型就是学生模型自己的一个初始冻结副本充当固定不变的裁判分别去看两张图一张是把关键区域清晰放大的证据呈现图一张是把这个区域故意模糊化的证据移除图。老师在这两种情况下对下一个词该是什么会给出两份不同的概率分布。这里出现了一个关键概念叫**ut**论文里用这个符号表示证据方向代理可以理解成一个信号衡量揭示证据这件事到底是支持还是反对某个候选答案以及支持或反对的力度有多大。ut是怎么算出来的就是拿证据呈现时老师给出的概率减去证据移除时老师给出的概率两者的差值。如果某个词在证据呈现后概率明显升高ut就是正的说明证据在支持这个词如果概率明显降低ut就是负的说明证据在反对这个词。这一步解决了VA-OPD的那个漏洞因为ut本身是有正负号的既能捕捉证据支持了什么也能捕捉证据推翻了什么不会漏掉负面信息。回到之前那个条纹还是格子的例子。用VAD的方式计算格子这个词对应的ut会是一个很大的负数因为证据出现后它的概率被压得很低。这个负数不会被忽略而是会被明确记录下来用来在后续训练里主动压低学生对格子这个错误答案的信心。第二步把老师的完整纠正意见往ut这个方向上做投影。论文里把老师完整的纠正信号叫做**rt**老师给出的、相对于学生当前判断的完整修改量把ut叫做视觉证据的方向标。VAD做的事情是计算rt和ut有多对得上只保留对得上的那部分叫做**r_vis**视觉可归因部分即老师的修改里真正能用视觉证据解释的那一块剩下的部分叫**r_res**残差指老师修改里无法用这次视觉对照解释的那一部分可能是语言习惯也可能是别的什么论文没有把它简单归为纯语言噪声而是谨慎地称为未被证据解释的部分。这个投影过程用了一个数学公式其中有一个系数叫**βt**它的计算方式保证了如果老师的修改方向和视觉证据的方向完全对不上也就是两者内积小于零这个系数就直接归零也就是说这次不施加任何视觉修正。只有当两者方向一致时才会按比例提取出对应的修正强度。这个设计其实很像医院里的双盲对照实验。医生想知道一种药到底有没有效果光看病人吃药后症状变化是不够的因为可能是心理作用也可能是自愈。真正靠谱的做法是设置对照组一组吃药一组吃安慰剂比较两组的差异这个差异才是药物本身的真实效果。VAD做的正是这件事老师看清晰图和看模糊图之间的判断差异才是视觉证据这个变量真正起作用的部分而不是老师这次判断的全部内容。如果VAD不做这个投影直接把rt整个当作目标那就退化回了Vision-OPD的老问题老师纠正意见里那七八成的混杂信号照样会被学进去。支持和反驳要分开算账搞定了哪部分该学之后VAD还做了一层更精细的处理把ut拆成支持和反驳两条分支分别控制力度。为什么要这么拆因为在实际场景里证据对不同候选答案的影响强度是不对称的。有时候证据非常明确地否定了一个错误答案就像前面格子从94.6%暴跌到2.0%但对正确答案的支持力度可能没有那么夸张。如果不加区分地用同一个系数去处理正负两个方向可能出现某一方向被过度放大或压缩的问题。论文的具体做法是把ut拆成正向部分u?证据支持的候选词和负向部分u?证据反对的候选词分别计算这两部分和原始纠正意见rt的一致程度得到两个认同分数再按比例分配一个总的修正预算。这里有个细节对正向支持这一侧论文额外设置了一个上限**τ**正向分支的封顶值4B模型设为0.89B模型设为0.7目的是防止某些不太确定的正向证据信号权重过大喧宾夺主。而反向反驳这一侧没有设上限因为证据明确说这是错的这种信号通常更值得完全信任不需要打折扣。这就像家长在批改孩子作业时的分寸感。如果孩子写错了一个字家长确定无疑地指出这是错的这种否定应该是干脆利落的不需要留有余地。但如果家长觉得某种写法或许更好这种建议式的肯定就应该温和一些留出孩子自己判断的空间不能一股脑地强加。VAD对支持和反驳设置不同的处理方式本质上是在模拟这种否定要坚决肯定要留有余地的分寸感。拿到这两部分修正量之后VAD把它们叠加重新构造出一个新的学习目标论文管这个叫**q_VAD**重新构造出来的、以学生当前判断为基础、只叠加视觉可解释修正的目标分布。这个目标不是直接照抄老师而是学生原本的判断 加上 经过筛选的视觉修正量相当于在学生已有的认知基础上做一次有依据的局部调整而不是整个推倒重来。光靠视觉信号还不够还得留一根安全绳VAD团队在实验中发现了一个有意思的副作用。如果只用这套视觉归因的目标去训练模型也就是完全抛弃老师原始判断中那些未被证据解释的部分模型的语言表现会开始跑偏回答变得又长又啰嗦容易重复车轱辘话该给出答案的时候拖泥带水甚至连什么时候该停下来结束回答论文里提到的EOS行为也就是模型判断该结束生成的机制都变得不稳定。这个现象其实很好理解。视觉归因这套机制聚焦的是这个词该不该改因为证据支持或反对它但它压根没有专门去管这句话说得顺不顺该用什么格式回答该在哪里收尾这些和语言表达能力相关的事情。就像一个只专注纠正你逻辑漏洞的老师从不管你的病句和标点符号你听他的话改完逻辑文章的行文流畅度可能反而变差了因为没人在管这块。所以VAD在正式训练里额外保留了一个**弱正则项**论文里叫Lreg一个权重较小的辅助损失作用是让模型别完全脱离老师原始判断中那些和语言表达、格式规范相关的内容。这个正则项的具体做法是先算出这次视觉归因修正占老师完整纠正意见的比例如果这个比例越小说明老师这次的修改大部分是未被证据解释的内容就给这个原始老师判断分配更大的权重用来兜底那些视觉归因机制没管到的语言层面的东西。最终整个训练损失是视觉归因目标的主损失加上这个弱正则项按一个较小的系数λ论文里设为0.1加权组合。这个安排的分寸感很清楚视觉归因是主角负责精准纠错原始老师判断是配角负责兜底防止语言表达失控。六个测试场景两个模型规模全面对比方法讲完了接下来看实际效果。研究者在六个专门考察细粒度视觉能力的测试集上做了对比包括V*、ZoomBench、HR-Bench分4K和8K两个难度、MME-RealWorld分英文和中文版本。这些测试的共同特点是题目往往依赖图片里某个很小、很容易被忽略的细节比如一小段文字、一个不起眼的物体属性。实验用了Qwen3.5系列模型的4B和9B两个规模版本训练数据完全一致6241条来自Vision-OPD公开的合成视觉问答数据保证公平对比。| 模型规模 | 方法 | V* | Zoom | HR-4K | HR-8K | MME-EN | MME-CN | 六项平均 ||---|---|---|---|---|---|---|---|---|| 4B | Qwen3.5基座 | 82.20 | 48.28 | 85.75 | 81.38 | 63.89 | 63.58 | 70.85 || 4B | GRPO强化学习基线 | 81.68 | 56.57 | 76.75 | 75.62 | 71.10 | 68.58 | 71.72 || 4B | Vision-OPD | 89.53 | 59.41 | 81.75 | 80.12 | 74.51 | 70.17 | 75.92 || 4B | VA-OPD | 90.05 | 58.11 | 81.88 | 78.75 | 73.29 | 67.42 | 74.92 || 4B | **VAD本论文** | **92.15** | **60.59** | 85.38 | 83.38 | **76.97** | **71.47** | **78.32** || 9B | Qwen3.5基座 | 86.39 | 52.31 | 85.12 | 80.88 | 71.13 | 67.31 | 73.86 || 9B | Vision-OPD | 92.72 | 59.26 | 85.13 | 83.75 | 71.76 | 68.65 | 76.88 || 9B | VA-OPD | 86.91 | 62.84 | 86.12 | 82.75 | 71.17 | 70.20 | 76.67 || 9B | **VAD本论文** | **94.76** | 62.49 | **87.88** | **85.75** | **76.56** | **72.13** | **79.93** |从这张表能看出几件事。VAD在4B规模下六项测试的平均分是78.32比同规模最强的对照方法Vision-OPD高出2.4分。在9B规模下平均分达到79.93比Vision-OPD高2.88分。差距虽然不算特别夸张但考虑到这是在完全相同的训练数据、相同的更新步数下取得的说明多出来的分数确实来自怎么构造学习目标这个环节的改进而不是靠堆数据堆算力。更有意思的是VAD的4B版本只有40亿参数平均分78.32居然超过了参数量大得多的闭源模型Gemini 3 Flash77.32分和Gemini 3.1 Pro78.04分也超过了397B参数的开源大模型Qwen3.5-397B76.49分。这里要泼一点冷水这种跨体系的对比只能作为参考因为不同模型的架构、训练数据、算力投入完全不同没法做严格的控制变量比较。但至少说明把学习目标构造得更精准能在小模型上撬动出不小的能力提升这本身是有价值的。拆开老师的话之后到底装的是什么VAD声称它能把视觉可解释的修正和其余部分分开但这个说法是不是真的成立光看最终测试分数还不够有说服力。研究者又做了一层语义层面的分析去看这两部分内容到底装了些什么词。他们把老师的完整纠正意见rt、拆分出来的视觉归因部分r_vis、以及剩余的残差部分r_res各自拿出高权重词汇做了分类统计分成五类视觉属性词比如颜色、材质、物体和内容词、选择题的选项符号A/B/C/D、语言和格式相关词、以及和图片裁剪、模糊等技术操作相关的杂项词。统计结果显示在r_vis这部分里视觉属性、物体内容、选项判断这三类加起来占了42.0%的比重而在完整的rt里这个比例只有26.7%在残差r_res里更是只有17.7%。反过来语言格式和杂项词汇在r_vis里占58.0%在rt里占73.3%在r_res里高达82.3%。具体到单个词A、B、C、D这几个选项符号以及竖直的金属的这类具体的属性词在r_vis里的权重明显更高。而toinside这类介词、连接词以及和裁剪、模糊化操作相关的词反而更多地留在了r_res里。这个结果说明VAD的投影操作不是简单地把老师的话按比例缩小而是真的把内容按语义做了重新分配。视觉归因部分承载的是这里该填什么答案这个物体是什么颜色什么材质这类和视觉证据直接相关的判断残差部分则更多是语言表达层面的东西。这就像把一份混录的音频文件用降噪软件分离出人声和背景噪声两条音轨。分离得好不好不能只听整体音量大小是不是降低了得听分离出来的人声轨道里是不是真的没有背景杂音而背景音轨里是不是没有把人说话的关键词也带进去。VAD这里做的语义分析就是在验证这种音轨分离的质量而不是简单地做音量缩放。拆开各个组件看看到底谁在起作用研究者还做了一系列消融实验就是把VAD拆开一个模块一个模块地去看它到底贡献了多少。他们对比了六种不同的学习目标构造方式直接用老师的完整判断最原始的Vision-OPD做法对老师判断做简单的等比例缩放但方向不变还是混杂的只做投影但不加区分支持反驳、也不加安全绳正则项的版本投影加安全绳但不区分支持反驳完整的支持反驳分离版本但不加安全绳以及最终的完整VAD。结果显示从直接照抄老师到简单缩放六项测试平均分只提升了0.27分几乎没什么用。但从简单缩放跳到不加安全绳的投影版本分数从76.19跳到77.06提升了将近1分。再从这个单侧投影升级到支持反驳分离版本分数又从77.06涨到78.06多了整整1分。加上安全绳正则项之后最终版本达到78.32。这组数字说明了一件事真正带来大幅提升的是把混杂的纠正信号拆开只保留视觉可解释部分这个核心操作而单纯的数值缩放几乎没用。这也从侧面印证了论文一开始的判断VA-OPD这类给整体判断加权重的方法之所以效果有限是因为它没有触及问题的根本就是学习目标本身是混杂的权重加得再巧妙混杂的内容还是混杂的。走出考试范围模型会不会水土不服一个模型如果专门针对某几类题目做了强化训练很容易出现过拟合的问题在训练涉及的场景里表现很好一旦换个完全没见过的任务类型反而不如没训练过的原始模型。为了检验VAD训练出来的模型有没有这个问题研究者专门找了四个和训练数据完全无关的测试集包括MMVP、CV-Bench、MMStar、POPE考察模型在这些陌生考场里的表现。结果显示在4B和9B两个规模下VAD都是唯一一个相比原始基座模型有正向提升的方法。4B规模下提升0.24分9B规模下提升0.23分。而其他对照方法比如GRPO在4B规模下反而倒退了4.2分VA-OPD倒退2.72分就连思路上和VAD比较接近的Decomposed OPD在9B规模下也倒退了1.36分。这个结果挺有意思。它说明VAD这套只学有证据支撑的部分的思路客观上起到了一种防止跑偏的作用。因为它没有强迫模型去模仿老师全部的判断习惯而是只学习那些真正和视觉证据相关的调整模型在专精能力提升的同时没有丢掉原本更广泛的通用能力。写在后面读完这篇论文最触动我的一点其实不是VAD这套方法本身有多精巧而是那个23.2%的诊断数字。一个团队愿意先花大力气去证明我们现在用的训练方式其实有问题而不是急着去堆一个更复杂的模型这个态度本身值得说一说。很多论文上来就是我们提出了更强的方法但很少有论文愿意先老老实实地量化一下现有方法到底混杂到什么程度用具体数字把问题钉死再去谈解决方案。另一个让我停下来想了一会儿的地方是VA-OPD那个漏掉负向证据的案例。这种错误不是那种一眼就能看出来的bug而是设计逻辑里一个很隐蔽的死角只往一个方向看优势天然就会漏掉另一个方向的信息。这种问题在很多打分系统里可能都存在只统计变好了多少却没人问变差了多少这个问题有没有被认真对待。还有一点没在正文里细说但值得单独提一句VAD承认自己的局限就是每次干预只用一组对照视图去估计视觉证据的方向这个估计本身可能存在偏差多角度、多视图或许能给出更靠谱的方向标。论文没有回避这一点反而把它明确写进了限制部分。一个AI模型能不能分清我这次改对是因为真看懂了还是因为习惯性地这么说这个问题放大来看其实和人类学习一件事时能不能分清我懂了还是我只是记住了是同一个问题的两种版本。QAQ1VAD是什么AVAD全称Visual Attribution Distillation视觉归因蒸馏是一种多模态AI训练方法。它的核心做法是通过对比证据呈现和证据移除两种情况下老师模型判断的差异只提取出真正由视觉证据支撑的那部分修正内容重新构造一份更精准的学习目标去训练学生模型而不是让学生直接照抄老师的全部判断。Q2VAD和之前的Vision-OPD、VA-OPD相比主要区别是什么AVision-OPD直接让学生模仿老师看清晰图后的完整判断问题是这个判断里只有约23%真正和视觉证据强相关。VA-OPD给纠正意见按视觉相关度打分加权但只统计正向增益会漏掉证据明确否定错误答案的负向信号。VAD则通过投影计算把老师判断拆成视觉可解释部分和残差部分只用前者重新构造学习目标同时正负两个方向都能兼顾。Q3VAD训练出来的模型效果具体好在哪里A在六个细粒度视觉测试上VAD在4B和9B两个模型规模下都取得了对照方法中最高的平均分分别是78.32分和79.93分比同规模最强对照方法高出2.4到2.88分。同时VAD训练出的模型在完全没见过的陌生测试集上也保持了正向提升没有出现专精能力提升但通用能力下降的问题。