一、核心问题要解决什么论文针对在线策略蒸馏On-Policy Distillation, OPD在大语言模型后训练中的两大根本缺陷优化不稳定OPD的奖励信号是教师与学生策略的对数概率比当教师对某个生成 token 概率趋近于0时该比值会发散到负无穷导致梯度爆炸、训练崩溃。样本效率低下OPD是严格的在线策略方法每次参数更新后旧数据立即作废无法重用导致大量计算浪费。二、核心方法怎么解决提出了TOP-D由两个关键机制构成三、理论贡献凭什么可靠论文给出了完整的理论闭环包括三大定理四、实验结论效果如何在数学推理任务AIME/AMC上使用 Qwen3 系列模型进行验证相比标准 OPD在 AIME24 上8B 模型 avg32 准确率从 24.58% 提升到 50.42%绝对提升 25.84%。相比 RLVR 强基线DAPO/GRPO同样场景下超越 DAPO 约 17.5 个百分点。小模型1.7B场景标准 OPD 性能崩溃TOP-D 仍稳定提升证明其对大能力差距场景更鲁棒。消融实验移除近端教师α1会导致训练震荡移除离线策略重用会导致收敛变慢验证了两个组件缺一不可。超参数敏感性αα 在 0.1~0.3 范围内表现稳定无需精细调参。TOP-D 通过对 OPD 的奖励信号做一个简单但有理论保证的平滑改造同时引入信任区域式离线数据重用在不增加任何计算成本的前提下显著提升了蒸馏训练的稳定性、样本效率和最终推理性能并在理论和实验上均大幅优于现有 OPD 和 RLVR 范式。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示图1标准OPD强制直接教师监督并遭受不稳定的优化而TOP-D通过在每次迭代中动态构建一个近端教师来确保稳定的训练。摘要宏大的目标难以一蹴而就将其分解为小步骤则更为明智。我们提出了信任区域策略蒸馏TOP-D它通过动态构建一个近端教师将 notoriously unstable众所周知的不稳定的、高方差的在线策略蒸馏OPD转变为一个稳定的训练范式。理论上我们建立了一个严格的框架证明TOP-D能够内在地控制梯度方差。通过提供正式的全局收敛分析和单调改进界限我们在数学上形式化了整体训练动态的可靠性和稳定性。实证上TOP-D在数学推理任务上显著提升了训练稳定性、样本效率和最终性能。更重要的是TOP-D引入了零额外计算开销使其成为既定OPD范式的一个有前景的替代方案。图2在几个AIME基准测试上应用于Qwen3-8B-Base模型的RLVR的avg32准确率以及使用Qwen3-30B-A3B-Instruct-2507作为教师模型的OPD和TOP-D的avg32准确率。1 引言在线策略蒸馏OPD[10] 已成为大型语言模型LLMs[18, 16, 21, 19, 1] 后训练的主流范式其中学生模型从外部教师提供的令牌级信号中学习。在数学上这等价于强化学习其中即时奖励由教师和学生策略之间的对数概率比定义。因此OPD的在线策略特性防止了监督微调SFT[14] 的灾难性遗忘而其密集奖励克服了基于可验证奖励的强化学习RLVR的样本效率低下和不稳定性如表1总结。尽管具有理论上的吸引力标准OPD在实践中仍遭受严重的优化脆弱性。OPD的根本瓶颈在于目标教师与学生之间固有的能力差距 [5]。由于标准蒸馏目标由两个策略之间的对数概率比驱动优化动态极易受到师生分歧的影响。最近的研究投入了大量的工程努力通过各种技术来缓解这种不稳定性包括师生混合采样 [3]、奖励裁剪 [7]、top-pp 采样 [2]、离线策略冷启动 [9] 以及扩展到全词汇监督 [1]。然而这些缓解策略在很大程度上仍然是经验性的启发式方法未能捕捉到不稳定性的根本机制教师和学生之间无界的对数概率差异。此外这些经验性方法天生缺乏可靠优化的理论保证。在本文中我们提出了信任区域策略蒸馏TOP-D来系统性地解决标准OPD固有的优化不稳定性。具体来说为了克服无界的对数信号我们通过在目标教师和当前学生的概率分布之间进行插值动态构建一个外部的近端教师如图1和第3.1节所述。这种数学构造将无界的蒸馏奖励转化为一个平滑的、严格有下界的信号从而在分析上防止了方差爆炸。在此基础上我们进一步引入了内部信任区域迭代在第3.2节中描述以更好地逼近当前的近端教师同时提高整体样本效率。至关重要的是虽然近端教师在概念上被构建但实际的优化目标在数学上简化为标准令牌级OPD奖励的简单代数变换。因此TOP-D引入了零额外计算开销作为一个即插即用模块与最先进的分布式训练基础设施 [15, 22] 和高吞吐量推理引擎 [8, 23] 天然兼容。除了这种经验上的优雅性我们提出的框架还建立了一个严格的理论闭环外部的近端教师严格限制了梯度方差在第4.1节中描述而内部的信任区域迭代保证了策略的单调改进在第4.3节中描述系统性地最小化单步优化误差从而紧密地闭合整体的渐近收敛差距在第4.2节中描述。总而言之本文的主要贡献如下我们提出了TOP-D一个即插即用的蒸馏范式它平滑了无界的奖励信号并安全地打破了标准OPD严格的在线策略数据重用壁垒。我们建立了一个严格的理论框架其中近端教师内在地限制梯度方差以稳定训练而我们的收敛分析和单调改进界限形成了一个闭环以系统性地最小化渐近误差。我们通过实证证明TOP-D在数学推理任务上显著提升了推理能力在AIME24基准上相较于标准OPDavg32准确率实现了25.84%的绝对提升并持续优于RLVR和OPD基线。2 预备知识2.1 在线策略蒸馏2.2 强化学习形式化3 方法论本节详细介绍了我们核心算法——信任区域策略蒸馏TOP-D的设计。我们首先在第3.1节中通过构建一个近端教师来稳定训练。随后在第3.2节中当前的学生模型通过执行信任区域迭代来逼近这个近端教师。最后第3.3节概述了TOP-D算法的实际实现。3.1 外部近端教师3.2 内部信任区域迭代3.3 信任区域策略蒸馏在本节中我们综合第3.1节中外部近端教师和第3.2节中内部信任区域迭代的概念以形成我们完整的算法框架——信任区域策略蒸馏TOP-D如算法1所总结。标准OPD存在两个根本瓶颈优化脆弱性和低样本效率。TOP-D通过一个统一的设计系统地解决了这两个问题。首先外部近端教师将无界的OPD奖励转化为一个平滑的、有下界的奖励从根本上稳定了优化过程。基于这一原则内部信任区域迭代将行为策略和目标策略解耦打破了严格的在线策略数据重用壁垒。至关重要的是这些机制不仅仅是经验性的启发式方法而且具有深层的理论协同作用。我们在第4节中严格形式化了这个框架并建立了其数学保证。4 理论分析在本节中我们为TOP-D建立了严格的理论基础。我们首先在第4.1节中证明近端教师内在地限制梯度方差以稳定优化。在此基础上我们在第4.2节中通过抽象学习动态推导出一个全局收敛界限。最后为了最小化该收敛分析中识别出的局部误差瓶颈我们在第4.3节中为我们的内部信任区域迭代建立了单调改进保证。4.1 有界方差4.2 收敛性分析4.3 单调改进实验在本节中我们通过实证验证了 TOP-D 的有效性。具体来说第5.1节详细介绍了我们的验证数据集、模型配置、基线方法和实现超参数。第5.2节将 TOP-D 与现有的后训练基线进行了全面比较。最后第5.3节对我们方法的核心组件包括外部近端教师和内部信任区域迭代以及敏感性分析进行了深入分析。5.1 实验设置数据集和基准。我们使用 DAPO-Math-17k [20] 数据集进行训练阶段这是一个高质量的数学推理语料库。为了验证我们在广泛认可且具有挑战性的数学推理竞赛如 AIME 和 AMC上对后训练模型进行基准测试。模型和基线。为了全面研究 TOP-D 的可扩展性及其在不同师生能力差距下的鲁棒性我们采用两种不同的基础模型作为学生Qwen3-1.7B-Base [18] 和 Qwen3-8B-Base [18]。对于目标教师策略我们使用 Qwen3-14B [18] 和性能极强的 Qwen3-30B-A3B-Instruct-2507 [18]。我们将 TOP-D 与几种后训练范式进行比较包括 GRPO [13]、DAPO [20] 和标准 OPD [10]。实现细节。在展开阶段学生模型为每个提示生成 8 个响应。为了执行信任区域迭代我们遵循与 RLVR 相同的离线策略设置将同一批数据分成多个小批量其中全局批量大小设置为 512 个提示4096 个样本小批量大小设置为 32 个提示256 个样本。TOP-D 的核心插值系数 α 设置为 0.1 或 0.2。在训练期间我们应用 1.0 的采样温度和 1.0 的 top-p。对于性能验证我们使用 1.0 的温度和 0.7 的 top-p。关于其他超参数的详细信息在附录 B 中提供。表 2Qwen3-8B-Base 在各种数学基准上的性能比较。5.2 主要结果表 2 和表 3 总结了 TOP-D 与其他基线相比的验证结果。TOP-D 在所有数学基准和学生模型规模上均持续优于评估的基线。与标准 OPD 相比最显著的改进得以体现。例如使用 Qwen3-8B-Base 学生模型并由 Qwen3-30B-A3B-Instruct-2507 教师监督TOP-D 在 AIME24 上达到了 50.42% 的 avg32 准确率比标准 OPD24.58%实现了 25.84%25.84% 的绝对提升。图 5Qwen3-1.7B-Base 上消融研究的学习曲线。我们隔离了外部近端教师α1.0和内部信任区域迭代w/o off-policy无离线策略的影响。这一巨大的性能提升确凿地证明了限制蒸馏奖励的方差能有效稳定训练过程并随后释放了学生的推理潜力。此外TOP-D 明显优于 RLVR 基线在相同的基准上其性能比极具竞争力的 DAPO 高出 17.5%17.5% 的绝对准确率展示了稳定的 TOP-D 相对于传统 RLVR 基线的优越性。当缩小到较小的 Qwen3-1.7B-Base 学生模型时标准 OPD 遭受了严重的性能下降明显落后于 RLVR 基线。这种脆弱性凸显了当师生能力差距严重时无界对数概率比的脆弱性。与此形成鲜明对比的是TOP-D 持续保持其显著优势。对于 1.7B 的学生模型TOP-D 将 AIME24 的准确率推高至超过 20%20% 的阈值并在 AIME24 和 AIME25 上均持续超过标准 OPD 超过 10 个百分点。5.3 消融研究为了深入理解驱动 TOP-D 成功的机制我们分离了其核心结构设计的影响。为此分析我们使用 Qwen3-1.7B-Base 学生模型并由 Qwen3-30B-A3B-Instruct-2507 教师监督。图 5 展示了 TOP-D 与其消融变体以及标准 OPD 基线在整个模型训练过程中的学习曲线。通过将插值系数设置为 α1.0我们移除了外部近端教师并将目标恢复为无界的标准 OPD 奖励。如训练曲线所示这种消融导致了高度不稳定的训练动态和整体性能的显著下降。另一方面通过禁用内部信任区域迭代表示为 w/o off-policy我们强制优化进入严格的在线策略模式。这导致样本效率急剧下降需要更多的训练步骤才能收敛并提升性能曲线。这些实证结果清楚地表明外部近端教师和内部信任区域迭代都是实现优化稳定性和快速性能提升不可或缺的组成部分。此外我们通过变化 α∈{0.1,0.2,0.3} 来评估 TOP-D 对插值系数的敏感性。我们凭经验观察到在此区间内训练稳定性、收敛速度和最终性能表现出微小差异。这表明 TOP-D 对 αα 的选择具有高度鲁棒性作为一种可靠的解决方案无需进行详尽且计算昂贵的超参数调整工作。6 结论在本文中我们介绍了信任区域策略蒸馏TOP-D这是一种原则性的后训练范式解决了标准在线策略蒸馏OPD的优化不稳定性和样本效率低下的问题。理论上TOP-D 通过外部近端教师限制梯度方差并通过内部信任区域迭代保证具有安全的离线策略数据重用的单调改进。实证上它在数学推理基准上取得了巨大的性能提升在多种模型规模上决定性地优于标准 OPD 和具有竞争力的 RLVR 基线。通过在没有额外计算开销的情况下实现这些进步TOP-D 为对齐基础模型建立了一个高度可靠、样本高效且稳健的范式。