尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

不学新本领,只做对选择:ReasonMaxxer 揭示大模型推理的“无强化学习”新范式

不学新本领,只做对选择:ReasonMaxxer 揭示大模型推理的“无强化学习”新范式 不学新本领只做对选择ReasonMaxxer 揭示大模型推理的“无强化学习”新范式南加州大学University of Southern California, USC和美国陆军研究实验室DEVCOM Army Research Laboratory, DEVCOM ARL联合研究指出强化学习RL提升大语言模型推理能力的本质并非让模型习得新技能而是在关键决策点对已有策略进行稀疏选择。通过对不同模型及其RL算法的令牌级分析研究发现RL仅修改了约1%至3% 的令牌位置且这些修改精准集中在高熵即模型不确定的决策点上。通过仅针对这些特定位置进行微调模型能够以极低维度的参数调整找回RL带来的大部分性能增益。基于此发现作者提出了REASONMAXXER方法这是一种无需RL流程的轻量化方案。该方法仅需极少量的基础模型采样和分钟级的单显卡训练即可在多项数学基准测试中达到甚至超越完整RL的效果。最终这项工作证明了通过熵门控决策点进行针对性优化可以将训练成本降低约三个数量级。论文ReasonMaxxer: Sparse Policy Selection as an RL-Free Reasoning Paradigm挑战了当前大语言模型LLM后训练中对强化学习RL的重度依赖提出了一套全新的、极低成本的无强化学习RL-Free推理能力提升范式。一、 核心观点强化学习本质是“稀疏策略选择”而非“能力习得”传统的观点认为RL如 GRPO 或 PPO能通过大规模探索让模型学到全新的推理路径。但论文指出RL 并没有赋予模型新的推理能力而只是对基座模型本就拥有的解空间进行概率质量的重新分配即召回并提升基座模型原本就具备的正确解。RL 的本质实际上是极少数关键分叉点上的精准纠偏。修正极度稀疏、保守且集中在“高熵决策点”RL 对基座模型的改变极为微小仅影响了1% ~ 3% 的 Token 位置。而且RL 几乎从不凭空创造新词它推荐的 Token 几乎全部属于基座模型原本预测概率的前 5 名Top-5。这些被修正的位置正是基座模型在多个推理分支间犹豫不决的高熵决策点Forking Tokens。纠偏具有因果决定性且能通过基座模型自身的熵直接定位干预实验表明仅在这些极少数的分歧 Token 上强行替换为 RL 模型的选择就能100% 恢复强化学习带来的全部准确率提升。更重要的是这些关键决策点不需要 RL 教师模型来寻找仅凭基座模型自身的 token 生成熵就能完美定位。纠偏信号在参数空间具有“极低维性”RL 对模型的分布修正可以用极小的参数量进行表征。通过在仅仅 100 个问题上进行 KL 散度蒸馏一个仅占模型参数总量约0.3%~0.5% 的 rank-32 LoRA 适配器就能完整复刻 RL 教师模型的推理准确率。无 RL 替代方案REASONMAXXER 算法基于上述发现作者推出了REASONMAXXER算法。其工作流非常简单挑选“边缘能力”问题筛选出基座模型采样生成的解答中既有正确也有错误混合成功率的问题。通过基座熵定位决策点当 Token 的生成熵 HtHt​ 超过设定阈值 ττ 时判定为决策点。优势加权对比损失Advantage-Weighted Contrastive Loss在决策点上对引导向正确答案的 Token 予以奖励对引导向错误答案的 Token 进行惩罚而在非决策点位置则通过 KL 散度将输出锚定Anchor到基座分布上防止模型过拟合。二、 关键数据1. Token 级别的微观数据特征修改占比极低在不同的模型家族Qwen2.5, Qwen3 等中RL 带来的 Token 重新排序Reranked仅发生在1.0% ~ 4.1%的位置。保守性极强将 Top-5 之外的 Token 提升到第一名的概率Shifted 概率几乎为零仅为0.01% ~ 0.12%RL 推荐的 Token 在基座中的平均概率排名为2.14 ~ 2.39。熵值差异巨大这些发生修改的决策点其基座模型熵值比未修改的位置高出5 ~ 12 倍具体为 7.58x ~ 12.63x。2. 极低维适配器与超轻量训练集微型适配器复刻 RL仅用0.27% ~ 0.49%的参数量LoRA 秩为 32并在100 个随机问题上蒸馏即可复刻 RL 模型的全部精度。REASONMAXXER 极小训练集仅需50 个具有混合成功率的数学问题每个问题采样 20 个 rollout总共 1000 个训练序列即可完成训练。相比之下传统的 GRPO 训练如 SimpleRL-Zoo需要使用 8,000 个甚至多达 57,000 个问题。3. 性能表现与惊人的成本缩减 (MATH-500 评测)在数学推理基准测试MATH-500中REASONMAXXER 以极低的计算成本匹配甚至超越了全量强化学习的基线模型与配置MATH-500 准确率估计训练成本 (USD)相比完整 RL 成本缩减Qwen2.5-1.5B (基座)29.8%--↪ SimpleRL-Zoo (GRPO)49.6%\$200基准线↪ Open-Reasoner-Zero (PPO)43.6%\$1,200基准线↪ REASONMAXXER50.2%\$4降低约 50x ~ 300xQwen2.5-7B (基座)58.6%--↪ SimpleRL-Zoo (GRPO)65.6%\$600基准线↪ Open-Reasoner-Zero (PPO)73.2%\$6,300基准线↪ REASONMAXXER70.6%\$5降低约 120x ~ 1260xDeepSeek-R1-Distill-1.5B (基座)43.6%--↪ DeepScaleR (GRPO)50.2%\$4,500基准线↪ REASONMAXXER66.2%\$4降低超 1000x4. 算法消融与鲁棒性数据熵阈值 ττ 的鲁棒性当 ττ 在 1.0 至 2.2 之间变化时算法性能表现非常稳定。在 τ1.4τ1.4筛选出5.2%的决策 Token或 τ1.8τ1.8筛选出2.6%的决策 Token时模型性能达到巅峰。对比惩罚Contrastive Loss的必要性如果仅对正确路径进行正向强化即类似于 SFT而不惩罚错误路径Qwen2.5-1.5B 在 MATH-500 上的得分仅能从 29.8% 提升到 39.8%而加上惩罚错误分支的对比损失后能飙升至50.2%这证明了“惩罚错误”贡献了大约一半的性能增益。https://arxiv.org/pdf/2605.06241
返回列表