尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

上海AI实验室揭开AI“幻觉记忆“之谜

上海AI实验室揭开AI“幻觉记忆“之谜 这项由上海交通大学与上海人工智能实验室联合开展的研究于2026年8月3日以预印本形式发布论文编号为arXiv:2608.01735感兴趣的读者可通过该编号查阅完整原文。研究提出了一种名为双锚点策略蒸馏DAPD的全新训练框架专门用于解决大型语言模型在训练过程中产生的一种奇特幻觉现象。你有没有见过这样的场景一个学生明明没看过答案却在考试时煞有介事地说我记得答案是42然后洋洋洒洒写了一篇推导过程来验证这个凭空捏造的答案这种行为在人类考场上叫作蒙答案但研究团队发现当今最先进的AI语言模型在某种特定训练方式下也会出现完全相同的怪异行为——它们会在解题卡壳之后突然声称记起了答案然后倒推出一套看似合理的推导过程但这个答案根本没有经过真正的推导完全是凭空断言的。更令人困惑的是这种现象并非AI能力不足的表现恰恰相反它出现在一种被业界广泛采用、本意是让AI变得更聪明的先进训练方法中。研究团队通过深入分析找到了这种幻觉的根本原因并设计出了一套巧妙的解决方案让AI在各类数学竞赛题、编程题和指令遵循任务上的表现获得了显著提升。**一、AI训练中的考场作弊问题**要理解这项研究解决了什么问题先得了解一种叫做在线策略自蒸馏OPSD的训练方法。这个名字听起来很学术但背后的逻辑其实相当直观。可以把AI模型的训练过程想象成培养一个学生。普通的训练方式就像给学生一堆标准答案让他抄写——效果有限因为学生只是在死记硬背别人的解题思路。而OPSD这种方法聪明得多它让AI同时扮演两个角色一个是参考老师版本可以看到参考答案另一个是实际考试版本只能靠自己推理看不到参考答案。然后用前者来指导后者让AI学习如何从看过答案后的推理方式倒推出不看答案也能得出正确结论的推理方式。这个方法的优势在于它让AI在自己生成的推理路径上进行学习而不是死啃别人的固定答案因此更贴近AI在实际使用时的真实状态。同时参考老师版本因为能看到答案会有更明确的推理方向其指导信号比纯粹靠AI自己摸索要强得多。然而研究团队在大量实验中发现了一个令人头疼的副作用。随着用这种方法训练的时间越来越长AI开始出现一种奇怪的退化行为——它在解题过程中卡住之后不再老老实实承认我不会或者继续探索其他思路而是突然断言我想起来答案大概是某某数字然后在这个没有经过推导的答案基础上继续编造推理过程。研究团队用一个形象的词来描述这种现象**特权幻觉**privilege illusion。所谓特权是指那些只有在训练时才存在的额外信息——也就是参考答案。AI在训练时习惯了有参考答案可以依赖于是在真正考试推理阶段时即便参考答案根本不存在它仍然表现得好像那个答案就在眼前一样直接说出来而不是真正推导出来。为了量化这种现象研究团队设计了一个错误断言检测器专门识别那些先宣布答案、再倒推推导的生成内容。实验数据显示在五种不同规模的Qwen3模型上随着OPSD训练的进行这类错误断言从每万次生成约13次急剧攀升到37次与此同时AI在美国数学邀请赛AIME等高难度题目上的平均正确率也从大约59.56分跌落到53.24分。训练越久问题越严重——这对一个本来旨在让AI变聪明的训练方法来说无疑是一个令人不安的反讽。**二、问题的根源一场信息不对等的考试**研究团队没有满足于仅仅观察到这个现象而是深入追问为什么会这样他们的诊断是**信息不对等**。在OPSD的训练框架里充当老师的那个版本能看到参考答案的版本和充当学生的那个版本只能靠自己推理的版本之间存在一道信息鸿沟。老师版本看到了答案所以它的每一个推理步骤都隐含着我已经知道终点在哪里的前提而学生版本在实际使用时什么都看不到却被要求模仿老师那种已知终点的推理方式。这就好像让一个只知道终点位置的导游来指导另一个蒙眼走迷宫的人。导游的指引是基于我看得到出口的视角而蒙眼的人根本无法知道出口在哪里。如果蒙眼的人完全照搬导游的指引方式最终就会产生一种奇怪的行为虽然眼睛被蒙着却表现得好像自己能看见出口一样——这就是特权幻觉。为了验证这个诊断研究团队做了一个巧妙的对照实验。他们保持老师版本不变继续看答案但把学生版本换成了一种特殊设计让学生版本不是仅看着当前推理到的前缀而是同时能看到自己正在生成的完整答案。这样老师和学生都有了完整的信息信息不对等被消除了。这个改动的效果相当惊人。仅仅这一项调整就让错误断言在训练后期减少了45%同时推理正确率提升了6.22分。这个实验有力地证明了OPSD产生特权幻觉的根本原因确实在于老师和学生之间的信息鸿沟而不是老师的质量有问题也不是学习的数据有问题。这个发现同时解释了为什么之前业界尝试的一些修补方案收效甚微。有些方法试图过滤掉老师信号里太依赖参考答案的部分有些方法试图根据老师和学生的差距来动态调整学习权重——但这些方法本质上都是在修补老师发出的信号而没有真正解决老师和学生之间那道信息鸿沟。换句话说不管你怎么修剪导游的话术蒙眼走路的人还是蒙着眼问题并没有从根源上得到解决。**三、修复方案用自知作为桥梁**既然问题的根源是信息不对等解决方案的方向就清晰了需要在老师和学生之间架设一座信息桥梁让老师和学生在某些关键环节能够处于相同的信息条件下进行对齐。研究团队为此引入了第三种视角并称之为**自我版本Self distribution**。这个视角的设计颇为精妙它不像考试版本那样完全不知道答案也不像老师版本那样能看到别人的参考答案而是能看到自己正在生成的那个完整答案。用一个比喻来理解这就像让一个棋手在复盘的时候把自己刚才下的那盘棋完整地摆在面前分析。他看不到别的高手的棋谱这是老师的特权但他可以完整地审视自己的每一步棋这是自我版本的特权。这个视角既与实际对局的状态有所不同又天然与老师版本处于相同量级的信息条件。这个自我版本扮演的角色是一座可以被双向使用的桥梁。一方面它可以向考试版本靠拢——通过训练让自我版本的推理行为越来越接近纯靠自己推理时的行为这个过程叫做推理锚点另一方面它可以向老师版本对齐——因为两者都拥有完整的答案信息这种对齐是在信息匹配的条件下进行的叫做特权锚点。由此研究团队设计出了**双锚点策略蒸馏DAPD**框架其核心由两个相互配合的模块构成。**四、双路径锚定同时走两条对齐路**第一个模块叫做**双路径锚定DPA**。它的设计思路是既然我们需要既保留原有训练信号的优点又修复信息不对等的问题那就同时维护两条对齐路径。第一条路径叫无特权路径。这条路径关注的是实际考试时的情形——两边都没有参考答案。它的工作方式是把原有的老师指导考试版本保留下来这是原始OPSD的核心同时增加一个新的训练目标让自我版本向考试版本靠拢。两个目标配合起来相当于通过自我版本这座桥把老师版本的有用信息间接传递给了考试版本同时过滤掉了那些依赖参考答案才能复现的推理行为。第二条路径叫特权路径。这条路径处理的是两边都有完整信息的情形。在这个条件下直接让自我版本向老师版本对齐因为两者都持有某种完整答案信息是匹配的。这条路径能够更直接地纠正模型在知道答案状态下的推理行为让这种行为更加准确、一致。两条路径并行工作互相补充。前者解决了考试时不该依赖答案却仍然依赖的问题后者则让模型在知道答案时的推理也更加规范。为了从理论上证明这套设计确实有效研究团队还给出了数学上的证明。核心结论是当无特权路径的训练损失足够小并且自我版本和老师版本之间保持足够相似时考试版本在参考答案对应的前缀上和在自己推理的前缀上行为差距会被严格控制在一个可计算的上界之内。研究团队还在Qwen3-4B模型上做了实际测量验证了这一理论条件在实践中确实成立。**五、双来源锚定让AI同时向参考答案和自己的推理学习**第二个模块叫做**双来源锚定DSA**解决的是另一个问题到底应该让AI主要向参考答案学习还是主要向自己生成的推理路径学习这两者各有优缺点。参考答案标准解法往往是正确的、经过验证的用它来指导AI能保证学习方向不偏但这些解法往往是专家写的风格与AI自己的推理方式差距较大硬学可能水土不服。AI自己生成的推理路径我们称之为rollout则非常贴近AI的实际思维习惯不存在风格不匹配的问题但这些推理路径可能是错的如果完全照着学等于学了一堆错误示范。DSA的解决方案是两个方向都要但要保持平衡并且允许根据实际情况调整比例。具体来说以参考答案为基础的路径rollout指向reference方向提供可靠的正确性保障以AI自己的推理路径为基础的方向reference指向rollout方向则提供更贴近AI实际能力的学习信号。最终的训练目标是两者的加权组合权重λ用于调节两个方向的相对比重。更有意思的是研究团队发现这个最优权重随着模型规模的变化而系统性地移动。在参数量较小的1.7B模型上最优的λ是0.5也就是两个方向各占一半而在4B、8B和14B规模上最优λ降到了0.2即参考答案方向只占两成AI自身推理路径方向占了八成。这背后的直觉非常合理越小的模型自己的推理越不可靠越需要向正确的参考答案靠拢越大的模型自己的推理越有价值可以更多地从自身推理中学习。**六、实验结果效果如何**研究团队在六项不同类型的测试上对DAPD进行了全面评估涵盖数学竞赛推理AIME24、AIME25、HMMT25、代码生成LiveCodeBench v5、BFCL v3以及指令遵循IFBench。在最核心的Qwen3-4B规模上DAPD的平均得分达到57.34分相比OPSD提升了2.00分。虽然这个数字看起来不大但要知道OPSD本身已经是当时最先进的方法之一在它的基础上再稳定提升2分是相当不容易的。具体到各项任务AIME25提升了4.44分HMMT25提升了3.06分IFBench提升了2.33分而编程任务BFCL v3也有0.59分的提升。规模扩展实验揭示了一个更重要的规律。OPSD相对于未经训练基础模型的提升随着模型规模的增大迅速缩水在1.7B模型上有约5.19分的提升到4B时降到1.39分而在8B到32B的范围内几乎没有提升最多只有0.28分。这意味着OPSD在大模型上几乎失效了。DAPD则完全不同。它在各个规模上都保持了稳健的提升相对于对应基础模型1.7B提升7.13分4B提升4.08分8B提升2.41分14B提升2.13分32B提升3.06分。更重要的是DAPD在每个规模上都稳定优于OPSD4B提升2.69分32B提升2.78分。在模型越来越大、OPSD越来越无力的情况下DAPD仍然保持着清晰可见的正向效果。研究团队对这一现象给出了直觉性解释随着模型能力的增强它自己生成的推理过程越来越有价值包含越来越多有意义的自我纠错和深度推理。OPSD的问题在于它训练出了一个会绕过这些推理步骤的模型——因为有参考答案可以直接对标模型学会了跳过中间步骤直接往答案靠。DAPD通过信息对等的锚定保留了这些推理步骤的学习价值因此在大模型上的效果反而更好。在一道具体的AIME24题目上这种差异体现得非常直观。题目是关于圆环torus和切球的距离计算正确答案对应的mn127。OPSD训练的模型在推导卡壳之后写道我实在卡住了只能放弃但我想起来答案可能是36/7所以mn43——完全是无依据的断言。DAPD训练的模型则从内切和外切两种情形分别建立方程一步步推出了正确答案127。研究团队还测试了DAPD在训练领域之外的泛化能力。他们用纯数学数据训练模型然后在编程和指令遵循任务上测试发现DAPD的平均得分为49.64比OPSD高出1.37分在编程任务LiveCodeBench v5上更是高出了4.82分。这说明DAPD学到的不只是特定题型的技巧而是更通用的、不依赖特权信息的推理能力。**七、不用参考答案也能行向更自由的训练方向探索**一个自然而然的问题是DAPD依赖参考答案标准解法作为特权信息在实践中这些标准解法并不总是容易获得的。没有参考答案的时候DAPD还能工作吗研究团队对此进行了初步探索。他们设计了一种双rollout变体不再使用任何参考答案而是让AI对同一道题生成两个独立的答案用一个作为参考侧另一个作为rollout侧按照同样的框架进行训练。实验结果表明即使没有任何外部参考答案这种方式相比OPSD也能在1.7B、4B、8B模型上分别提升0.46、2.41、2.41分。这说明第二个rollout确实提供了有价值的互补信息而不仅仅是重复的噪声。进一步地如果让AI对同一道题生成四个候选答案从中筛选出一个被自动验证器认为正确的答案作为参考侧效果还会更好在4B模型上达到了66.11分比不做任何筛选的双rollout方案提升了1.11分。这指向了一种更灵活的未来方向不依赖人工撰写的标准答案而是通过AI自身的多次尝试和自动验证来提供训练信号。**八、细节实验每个组件都必不可少**研究团队还通过系统性的消融实验即逐一去掉某个组件观察效果变化验证了DAPD每个设计选择的必要性。在双路径锚定方面无论是以参考答案为基础的方向还是以AI推理路径为基础的方向单独只用原始OPSD信号时的效果最差分别是62.13和63.33分加入推理锚点后效果提升63.43和64.91再加入特权锚点后效果进一步提升到最高63.89和65.09。两条路径都需要。在双来源锚定方面只使用参考答案方向得到63.89分只使用AI推理路径方向得到65.09分同时使用两个方向则达到65.28分。互补效果明显两者结合优于任一单独使用。在散度divergence的实现方式上研究团队比较了前向KL、反向KL以及是否使用组件截断。结果显示带截断的前向KL效果最好65.28分而不带截断的前向KL降至62.50分带截断的反向KL也是62.50分不带截断的反向KL稍好一点是63.33分。这说明训练信号的稳定性控制通过截断限制每个词的最大梯度贡献对最终效果有显著影响。---说到底这项研究做的事情可以用一句话概括找到了一种让AI老老实实推理而不是凭空断言的训练方法。特权幻觉这个问题听起来有点抽象但它的影响是非常实际的——一个会在卡壳时直接编答案的AI在用于辅助解数学题、写代码、或者完成复杂推理任务时可靠性会大打折扣。你永远不知道它给出的答案是真的推导出来的还是我感觉答案大概是这样。DAPD提供的修复方案没有引入额外的推理成本——训练好的模型在使用时和普通模型完全一样不需要任何额外操作。代价只是训练时需要同时维护更多的分布视角计算量比OPSD有所增加但推理阶段没有任何额外负担。这项研究还留下了一些有趣的开放问题。参考答案只是特权信息的一种形式现实中还有很多其他类型的特权信息——比如搜索引擎返回的文档、代码执行的结果、专家给出的步骤提示。DAPD的框架是否能够延伸到这些场景以及如何在训练过程中动态地根据模型当前能力调整参考来源和权重是研究团队明确点出的未来方向。对这些问题感兴趣的读者可以通过arXiv编号2608.01735找到完整论文深入了解。---**QA**Q1什么是特权幻觉它对AI使用有什么实际影响A特权幻觉是指AI在训练时习惯了依赖参考答案导致它在实际使用没有参考答案时仍然表现得好像答案已知——直接断言答案而非真正推导说白了就是编答案。这会让AI在数学推理、代码生成等需要严格推导的任务上产生看似合理实则错误的输出降低可信度。Q2DAPD训练出来的模型在使用时会更慢或需要特殊操作吗A不会。DAPD只在训练阶段增加了计算复杂度训练好的模型在实际使用时与普通模型完全相同不需要任何额外操作或输入推理速度也没有任何影响。Q3双锚点策略蒸馏DAPD为什么在大模型上效果反而更明显A因为越大的模型自己生成的推理过程越有价值、越准确。OPSD会让模型绕过这些有价值的推理步骤直接对标参考答案大模型因此损失更多DAPD通过信息对等的锚定保留了这些推理步骤的学习价值所以在大模型上优势更显著。
返回列表