南开大学与北京理工大学等团队联手破解AI“学习困境“
这项由南开大学、北京理工大学、浙江大学、中国科学院自动化研究所、哈里工业大学及中关村学院等多家机构联合开展的研究以预印本形式发表于2026年7月论文编号为arXiv:2607.17247有兴趣深入了解的读者可通过该编号查询完整论文。你有没有想过那些能够帮你写代码、解数学题、回答各种刁钻问题的AI助手究竟是怎么变得越来越聪明的说穿了它们的进化过程其实和人类学习没什么本质区别——要么自己反复练习、在错误中成长要么找个更厉害的老师跟着老师学新东西。然而这两条路各有各的麻烦就像一个学生光靠自己刷题会遇到瓶颈而一味照抄高手答案又学不到真本事。这篇论文提出的蒸馏强化学习Distilled RL正是为了解决这个两难困境而生的。一、两条路各有各的坑要理解这项研究解决的问题先得搞清楚AI模型目前主要用哪两种方式来变聪明。第一种叫做强化学习RL。打个比方这就像一个学生靠自己做题、对答案来提高成绩。AI每次给出一个答案系统会告诉它对了或者错了然后AI根据这个反馈调整自己的思路。这种方法的好处是AI完全依靠自己的力量成长不会被外界带偏但坏处也很明显——它只知道最终结果对不对却不知道中间哪一步出了问题。就好比你做了一道数学大题老师只告诉你算错了但不指出是哪个步骤出了差错你下次还是可能在同一个地方翻车。更关键的是强化学习只能强化AI本来就会的东西对于那些AI从来没见过、完全不会的知识单纯靠自我练习几乎没有用。第二种叫做在线蒸馏OPD。这就像是让一个学生跟着大师学艺——不是照着大师留下的笔记背而是实时观察大师如何解题然后努力模仿大师的每一步思路。具体来说AI学生自己先写一个答案然后逐字逐句地和AI老师通常是一个更大、更强的模型做对比拼命让自己的每个词都和老师选的词口味相似。这种方法的好处是反馈非常细致每个词都有指导坏处同样显而易见。当老师和学生本来就差不多时学来学去也没多少新东西而当老师和学生差异很大时强行模仿反而适得其反——就像让一个刚学英语的人直接模仿莎士比亚的写法只会越学越乱。研究团队通过大量实验清晰地观察到了这两个问题的具体表现。在训练曲线图上在线蒸馏在训练开始阶段进步飞快但很快就撞上了天花板成绩开始停滞甚至下滑尤其是在老师和学生来自不同家族也就是结构和训练背景差异很大的情况下这种崩塌更加明显。强化学习则进步缓慢但能持续爬升。把两者直接混合使用的方案在训练后期同样出现了性能下滑说明单纯叠加并不能解决根本问题。研究团队还特别验证了一件事增加在线蒸馏时AI自己采样的次数并不能改善瓶颈——把采样组数从1增加到4再增加到8效果几乎没有变化。这说明问题的根源不在于练得不够多而在于这种无条件模仿大师的学习方式本身有缺陷。二、新方法的核心思路让老师成为选择性顾问而不是必须照搬的权威既然两条路各有短板研究团队的思路是把老师的指导融入进强化学习的过程里但不是让学生无条件地模仿老师而是让老师在关键时刻提供精准的、有选择性的指导。这就是蒸馏强化学习Distilled RL的核心理念。可以用一个学棋的比喻来理解整个框架。假设你在学围棋你的师傅老师模型是个高段位选手。传统的在线蒸馏就是让你每走一步棋都要努力模仿师傅在同样情况下最可能走的那步不管你走的这步棋最终是赢棋还是输棋。而传统的强化学习只告诉你这盘棋最后赢了还是输了至于哪步棋下对了哪步棋下错了全靠自己猜。蒸馏强化学习则采用了一种更聪明的方式它先让你按照自己的想法下棋然后看这盘棋最终的走向只有当这盘棋整体来看是值得学习的好局时才参考师傅在每一步棋上的偏好让你从师傅那里汲取更多智慧而当这盘棋本来就是一场失败的烂棋时就直接沿用原来强化学习的惩罚机制不让师傅的偏好来干扰这步棋要受到惩罚的判断。三、三个精妙的技术设计这个框架的具体实现由三个环节组成每个环节解决一个具体问题三者合在一起才构成完整的蒸馏强化学习。第一个环节叫反向重要性采样。在强化学习中有一个常用的技巧叫重要性采样它的作用是把旧版AI选择的方案的权重调整成适合当前版AI的权重。蒸馏强化学习把这个方向反过来了它计算的是老师模型和旧版学生模型对每一个词的偏好差异比值。具体来说如果老师非常喜欢某个词老师选这个词的概率远高于学生旧版本这个词就会得到一个大于1的权重反之如果老师对某个词不太感冒这个词就会得到一个小于1的权重。这个权重衡量的是老师比学生旧版本更偏好这个词的程度。为了防止这个比值出现极端情况比如某个词老师极度偏爱但学生完全不用导致比值爆炸性增大设计中对这个比值做了截断处理把它限制在一个合理的区间内确保训练过程不会失控。第二个环节叫负样本重置。这是整个方法中最精妙、也最关键的设计。回想一下前面下围棋的比喻当学生自己走的棋整体上是好棋也就是这次回答得比较好、整体评分为正时引入师傅的偏好来调整每一步棋的权重是有意义的——师傅偏爱的步骤得到强化师傅不喜欢的步骤被相对削弱从而在好的大方向下实现更精细的优化。但当学生走的棋整体上是烂棋这次回答整体评分为负时情况就不同了。在强化学习中烂棋中的每一步都应该受到惩罚让AI知道这么走是不对的。如果这时候还引入师傅的偏好就会出现一个荒谬的结果师傅偏爱的步骤在烂棋里反而会因为权重变大而受到更严重的惩罚等于在逼着AI故意避开师傅的思路。这显然是错误的。负样本重置的解决方案非常直接当一个回答整体评分为负时直接把所有词的老师权重重置为1也就是完全恢复到普通强化学习的状态让原始的惩罚信号正常发挥作用不让师傅的偏好在错误方向上帮倒忙。第三个环节叫序列级几何归一化。这个设计解决的是一个更隐蔽的技术问题。AI生成一段文字时是一个词一个词地往后写的而整段文字的总概率是每个词的概率相乘得到的。老师模型和学生模型毕竟是两个不同的模型它们对整段文字的总体喜好程度在数量级上就可能有很大差异。如果把所有词的老师偏好比值直接相乘结果可能非常小远小于1这样就相当于把好的回答整体压缩了让训练信号整体变弱学不到什么东西。几何归一化的做法是对一个回答里所有词的老师偏好比值做一次整体校正——把每个词的比值除以这个回答里所有词比值的几何平均数让整体相乘结果等于1。这样一来老师的指导就不是在整体上放大或缩小这个回答的重要性而是在回答内部重新分配学习的侧重点老师更偏爱的词得到更多关注老师不太偏爱的词得到相对少一些的关注而整体的学习力度保持不变。四、一个优雅的验证实验用温度来测试知识传递光靠最终的评分表来说明效果还不够直观研究团队设计了一个非常巧妙的案例研究来直接展示蒸馏强化学习是否真的能传递知识。这个实验用了一个叫熵的概念来做测试。在AI语言模型的语境里熵可以理解为AI在选词时的不确定性或者AI选词的随机程度——熵高说明AI给很多候选词都分配了差不多的概率不太确定选哪个熵低则说明AI非常笃定地认为某个词最合适。通过控制温度参数一个影响AI选词随机性的数值可以人为地让一个模型变得更犹豫高温度、高熵或者更果断低温度、低熵。实验的巧妙之处在于研究团队不用一个更大的外部模型当老师而是用学生模型自身当老师——但给了它一个会随时切换的温度控制规则当学生当前的熵超过0.5时老师就切换到低温度0.8告诉学生你现在太犹豫了要果断一点当学生的熵低于0.5时老师就切换到高温度1.2告诉学生你现在太死板了要灵活一点。如果蒸馏强化学习真的能传递老师的分布特征学生的熵就应该在0.5附近来回振荡跟着老师的温度信号走。实验结果清晰地显示学生的熵确实迅速向0.5靠拢然后在这个目标区域附近持续振荡——老师降温时学生熵下降老师升温时学生熵上升整个系统像一个精准的恒温器。这个实验直接证明了蒸馏强化学习能够把老师分布的特征性质传递给学生而这种传递是原始强化学习完全做不到的因为原始强化学习的信号只有最终答案对不对完全不包含任何关于分布特征的信息。当去掉负样本重置这个环节再做一遍同样的实验时学生的熵就完全无法跟随老师的温度信号始终维持在一个远低于目标的水平。这个对比实验非常直观地说明了负样本重置对于知识传递的关键作用——没有它在负样本上反方向施加的老师偏好权重会抵消乃至压制正样本上的正确引导。五、实验结果在各种难度的考场上都更胜一筹研究团队在多个评测维度上验证了蒸馏强化学习的效果对比对象包括三个基准单独使用在线蒸馏OPD、单独使用强化学习RL具体采用GRPO算法、以及两者直接相加混合使用OPDRL。测试的学生模型包括规模为15亿参数的DeepSeek-R1-Distill-Qwen-1.5B简称DSQW-1.5B、规模为17亿参数的Qwen3-1.7B以及规模为40亿参数的Qwen3-4B老师模型统一使用规模为80亿参数的Qwen3-8B-GRPO。训练数据集使用DAPO-17K共训练160步。在最难的测试场景中表现的差距最为显著。DSQW-1.5B和Qwen3-8B-GRPO之间不仅参数规模差距悬殊而且两者来自完全不同的模型家族一个是DeepSeek系列一个是Qwen系列推理风格和内部结构都有很大差异这被称为跨家族蒸馏场景。在这个场景下在线蒸馏虽然比不训练要好但比单纯用强化学习还差说明硬性模仿在家族差异很大时根本行不通。把两者混合使用也没有帮助后期同样出现性能下滑。蒸馏强化学习则实现了最大幅度的提升把DSQW-1.5B的综合成绩从31.70分提升到了40.00分比在线蒸馏高出4.73分比纯强化学习高出3.14分。在Qwen3-4B这个同家族场景下整体成绩从46.33分提升到了58.96分比在线蒸馏高出2.99分比纯强化学习高出1.56分。Qwen3-1.7B同样实现了稳定的全面领先。训练过程中的动态曲线也清楚地显示蒸馏强化学习的奖励值始终保持在最高水平策略的随机性熵保持在一个适中且稳定的区间既不会因为过于随机而难以收敛也不会因为过于保守而失去探索能力回答长度也保持稳定没有出现越回答越短或者越回答越啰嗦的异常现象。在知识类测评MMLU-Pro和SuperGPQA上蒸馏强化学习同样保持了竞争力说明这种训练方法没有让AI只会解数学题而是在提升推理能力的同时保留了广博的通识知识。在Pass16评测也就是同一道题让AI回答16次看能不能至少有一次答对上蒸馏强化学习同样表现最佳说明它不仅提高了AI最常给出的那个答案的质量还拓宽了AI整体的答题能力分布。六、去掉某个环节会发生什么研究团队还做了消融实验分别去掉负样本重置和序列级几何归一化来验证每个设计的必要性。去掉负样本重置的后果是最严重的。在Qwen3-4B上综合成绩平均下降了8.81分在DSQW-1.5B上平均下降了6.39分。这个下降幅度甚至比完全不用老师指导还要差直接说明了在错误回答上盲目引入老师偏好不仅没有帮助反而是有害的。前面提到的熵控制实验里去掉这个环节后学生完全无法跟随老师的温度指令也从另一个角度印证了这一点。去掉序列级几何归一化的后果相对温和一些但同样稳定地导致性能下降在两个学生模型上分别下降了1.24分和1.47分。这说明即使方向对了只在正样本上引入老师权重如果不做整体校正老师和学生之间的概率尺度差异还是会系统性地压制学习信号让训练效果打折扣。七、这个方法还有什么局限性研究团队在论文中也坦诚地指出了这个方法目前的不足之处。最核心的限制在于整个训练过程中老师只被用来评估学生自己写出来的答案而不是被要求自己先写出正确答案来。这意味着训练过程无法直接判断老师对某道题是否真的会做。虽然负样本重置机制在一定程度上缓解了这个问题因为在学生自己也答错的题目上老师权重会被归零但仍然存在一个隐患在那些学生答对了、但老师其实并不比学生强的题目上老师的词偏好权重可能反而是一种干扰把学生往错误的方向引导。随着训练推进学生的能力在某些领域可能超过了固定不动的老师这时候老师的意见就会变得不那么可靠。未来的改进方向可以考虑给老师设置一个能力评估机制比如偶尔让老师也完整地回答一道题来检验它是否真的会做或者根据老师给出建议的一致性和置信度动态调整对老师建议的参考程度。说到底这项研究解决的问题可以用最简单的话来描述以前的AI训练方法要么让AI只靠自己摸索进步慢、遇到瓶颈要么让AI无条件模仿老师容易过拟合、跨家族时适得其反而蒸馏强化学习找到了一条中间道路——让老师在合适的时机、以合适的方式、选择性地给出精细指导而不是当一个学生必须全盘照搬的权威。实验结果表明这条路走对了尤其是在老师和学生差异最大的情况下优势最为明显。对于普通用户而言这意味着未来的AI助手有望在更少的计算资源消耗下达到更高的推理能力特别是那些规模较小、可以在普通设备上运行的AI模型也能借助更大模型的知识来弥补自身能力的不足这对于AI技术的普惠化有着直接的推动意义。有兴趣深入了解技术细节的读者可以通过arXiv编号2607.17247查阅完整论文。QAQ1蒸馏强化学习和传统知识蒸馏有什么本质区别A传统知识蒸馏让学生模型无条件地在每一步都模仿老师的词概率分布不管学生自己的回答好不好。蒸馏强化学习只在学生回答整体较好的情况下才参考老师的逐词偏好在学生回答较差的情况下会恢复为普通强化学习的惩罚机制本质上是把老师的指导变成了有条件的精细辅助而不是无条件的全面模仿。Q2蒸馏强化学习为什么在跨家族蒸馏里效果特别明显A跨家族指的是老师模型和学生模型来自完全不同的训练背景和架构系列二者的用词偏好和推理风格差异很大。传统在线蒸馏在这种情况下因为强行模仿而导致性能下降而蒸馏强化学习通过负样本重置和几何归一化避免了对差异化分布的盲目跟随只保留了相对有用的老师偏好信号因此在差异最大的场景下反而收益最显著。Q3负样本重置去掉之后为什么成绩会比不用老师还差A当一个回答整体是错误的强化学习本应对其中每个词施加惩罚。但如果此时加入老师偏好权重老师比较喜欢的词反而会因为权重变大而受到更重的惩罚等于在错误轨迹上把老师偏好当成了需要避免的行为来训练方向完全反了。这不仅浪费了老师的参考价值还会主动把学生推向与老师相反的方向造成比不引入老师还要差的结果。