Meta:重要性采样修正引导训练
标题Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information来源arXiv, 2607.19313v1️文章简介研究问题在强化学习验证奖励RLVR中当模型面对高难度问题时因无法生成正确解而导致梯度为零学习悬崖现有引入特权信息的引导方法虽能打破悬崖却因训练与部署上下文不一致导致目标错位如何修正这一偏差主要贡献论文提出Off-Context GRPOOC-GRPO通过最小化修改GRPO算法利用重要性采样对引导生成的rollout进行加权修正确保在利用特权信息探索的同时无偏地优化原始无引导目标。重点思路识别“离线上下文”问题现有方法在训练时注入解题前缀等特权指导以生成成功样本但计算梯度时仍假设样本来自原始提示导致优化目标与部署目标不匹配引发训练不稳定或性能下降。引入重要性采样修正OC-GRPO在计算每个token的优势函数时乘以重要性比率即当前策略在无引导提示下的概率与旧策略在引导提示下概率的比值。这使得基于引导分布采样的期望等价于原始无引导分布的期望。行为感知信用分配理论证明该修正机制能自动调整信用分配。对于依赖引导才成功的轨迹其获得的正向奖励会被抑制对于即使有引导仍失败的轨迹其受到的惩罚会被放大从而鼓励模型学习真正的推理能力而非单纯模仿提示。控制方差与成本重要性比率的方差仅随引导前缀长度增长而非整个回答长度因此建议使用能打破学习悬崖的最短引导前缀。提供了固定引导和自适应引导两种实现方式前者预计算最小引导层级成本低且效果好。分析总结性能显著提升在Qwen2.5-7B模型上OC-GRPO在数学推理基准测试中平均Pass1相比 vanilla GRPO提升了3.9%相对增益13.8%优于POPE、PrefixRL等现有引导基线。小模型优势明显在3B和1.5B较小规模模型上未修正的引导基线性能甚至低于vanilla GRPO而OC-GRPO仍保持显著增益证明重要性修正在模型容量有限、难以吸收目标错位时至关重要。防止训练崩溃实验显示若不进行重要性修正引导训练会导致梯度范数激增和奖励坍塌而OC-GRPO能保持训练稳定确保学习目标与部署环境一致。个人观点论文指出了引导式RL中“采样分布”与“优化目标”之间的分布偏移问题并巧妙借用离线RL中的重要性采样既防止新旧策略差异过大又防止过度诱导导致后续分布差异过大。