尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

中国科学院自动化研究所:AI智能体如何从“记动作“到“理解世界“

中国科学院自动化研究所:AI智能体如何从“记动作“到“理解世界“ 这项研究来自中国科学院自动化研究所认知与决策智能重点实验室及中国科学院大学人工智能学院论文以预印本形式于2026年7月27日发布在arXiv平台编号为arXiv:2607.24720v1。有兴趣深入了解的读者可以通过该编号在arXiv上查阅完整论文。假设你是一位厨师学徒刚开始学厨时师傅给你一张食谱短步骤食谱你照着做能做出简单菜肴。但有一天师傅要你独立完成一桌十几道菜的宴席——从采购食材、掌控火候时机、协调每道菜的出餐顺序到最后摆盘上桌——这就完全是另一码事了。你不仅要记住每道菜的做法还要在脑子里维持一张整体规划图随时根据当前情况调整接下来的步骤。当前的AI智能体面临的正是这个困境。它们在简短任务上表现不错但一旦任务变长、步骤变多就会频频出错甚至彻底迷失。这背后的核心挑战被研究人员称为多轮长程规划——AI需要在连续多次与环境交互中始终保持清晰的目标意识和合理的行动计划。来自中国科学院的研究团队决定系统性地回答一个困扰整个领域的核心问题AI的长程规划能力究竟是怎么来的在训练的不同阶段又是如何变化的这个问题的难点在于现有的大语言模型都是在互联网上海量的不透明数据上训练出来的根本搞不清楚某项能力到底是什么时候、怎么被学会的。于是研究团队另辟蹊径构建了一套完全受控的实验环境像做物理实验一样精确地研究这个问题——这也正是论文标题中物理学一词的来由。研究团队把整个训练过程分成三个阶段来研究预训练阶段相当于厨师学徒打基础的学习期、基于强化学习的后训练阶段相当于参加烹饪比赛磨练技艺、以及多教师模型融合阶段相当于同时向多位大厨拜师学艺并融会贯通。每个阶段都有各自关键的发现合在一起构成了一幅关于AI长程规划能力的完整图景。一、研究的实验舞台一个专门设计的配方炼制世界要理解这项研究做了什么得先认识研究团队搭建的这个特殊实验环境。他们没有使用现成的AI模型和真实世界数据而是从零开始构建了一个完全可控的合成宇宙。这个宇宙包含三个不同的虚构领域奇幻炼金术、畜牧农场和电子组装。每个领域里都有一套物品合成规则就像游戏里的合成系统——用草种和水可以种出草草和小羊可以变成羊毛羊毛和纺锤可以织成毛线最终才能做出毛衣。整个合成网络有五个层级每层有40个物品类别每类有20种具体实例总共形成了一个复杂的多层树状结构。任务的设计也非常精妙。AI智能体每次会收到一个目标物品比如我想要一件毛衣和一堆初始材料包括有用的和没用的干扰项然后需要在有限步数内通过一系列合成操作完成目标。任务难度分三档短程1-5步、中程6-8步和长程9步以上。关键在于合成规则不会直接告诉AIAI必须通过与环境互动来学习和推断这些规则——这才是真正考验长程规划能力的地方。研究团队在这个环境里精确控制了数据格式、数据分布、数据质量和规划模式就像在实验室里控制变量一样。他们从头训练了一个基于Qwen2.5架构的1亿参数模型避免了大型预训练模型中预先埋藏了什么能力这一无法排查的干扰因素。评估指标使用的是avg8独立运行8次的平均成功率和pass88次中至少有一次成功的比例每个测试子集包含160个实例确保评估的可靠性。二、预训练阶段的第一课AI到底在学背动作还是懂世界第一个核心问题是AI在预训练阶段应该以什么方式学习规划研究团队对比了两种截然不同的训练方式。第一种叫直接预测动作——AI看到当前状态后直接输出下一步操作不做任何中间推理像是一个只记住了食谱步骤的厨师凭肌肉记忆做菜。第二种叫世界模型内化——AI在输出动作之前会先在内心构建一个关于当前环境状态的推理链预测每个动作会带来什么变化像是一个真正理解了烹饪原理的厨师能在脑子里模拟每一步操作的后果。具体来说世界模型方式要求AI在回答之前用类似目标是合成星级药水合成规则是红宝石矩阵加独角兽矩阵但两者都不在当前库存里……因此需要先合成红宝石矩阵红宝石矩阵需要仙女凝胶和石英溶液……这样的推理链条层层展开直到找到当前库存中确实存在的材料然后才给出具体操作指令。结果非常明确世界模型方式在短程任务上的平均成功率avg8达到98.9%而直接预测方式只有89.5%提升约9.4个百分点。这个差距在中程任务上扩大到39.3个百分点在长程任务上更是高达45.8个百分点。换句话说两种方式在简单任务上差别不大但任务一变长差距就像雪球一样越滚越大。不过事情并非一边倒。研究团队观察训练曲线后发现直接预测方式的确学得更快——在训练的早期阶段它的表现上升速度更快需要的训练步数更少输出的文字也更短消耗的计算资源更少。这是因为直接预测本质上是在学背答案而世界模型则是在学理解规律。背答案快但上限低理解规律慢但最终能举一反三。这个发现背后有一个深刻的道理AI要真正具备长程规划能力不能只会背动作序列而需要在内心建立一个关于环境如何运转的模型。这个内心的世界模型让AI能够模拟未来几步的后果从而做出更好的当下决策。三、预训练阶段的第二课只学简单步骤能拼出复杂任务吗第二个问题更加根本如果AI只见过简单的单步操作它能自己拼出复杂的长程规划吗这个问题在认知科学里叫组合泛化——掌握了A技能和B技能能不能自动学会AB技能的组合研究团队设计了一系列实验把训练数据按难度分成三档短程、中程、长程然后测试只用短程数据训练的AI面对中程和长程任务时的表现。答案让人印象深刻完全指望原子级别的技能自动组合是行不通的。当AI只在短程任务1-5步上训练时它在短程测试中pass8可以达到93.12%但面对中程任务时只有0.83%面对长程任务时直接归零。这说明AI确实学会了各个单独的合成步骤但它无法自发地把这些步骤串联起来完成更长的任务链。然而只需要极少量的长程数据就能打开这扇门。仅仅加入5%的中程轨迹中程任务的pass8就从0.83%猛然跳升至51.88%——提升了63倍同样加入5%的长程轨迹长程任务的pass8从0提升到11.46%。这种拨云见日式的突然提升表明AI其实已经具备了长程规划所需的基础知识缺的只是如何把这些知识串联起来的示范。就像一个学过了所有乐器基础知识的学生只需要看几次乐团排练就能明白各个乐器该如何协同演奏。这一发现对于实际的AI训练有重要指导意义在以短程数据为主的训练集中有意识地加入少量长程演示数据就能显著激活模型的长程规划能力而不需要大量昂贵的长程数据。四、预训练阶段的第三课训练数据里混进了坏示范后果很严重第三个问题关乎数据质量如果训练数据里混进了一些错误的、次优的操作示范会怎样在现实世界中收集到的数据不可能都是完美示范。研究团队模拟了这种情况把最优轨迹和次优轨迹按不同比例混合。次优轨迹的特点是推理过程可能写得头头是道但实际采取的动作却是错误的比如随机拿了两个材料往一起合没有什么道理。实验结果触目惊心。当训练数据包含4份最优轨迹和8份次优轨迹时短程任务的表现从100%跌落到73%中程任务更是从接近90%直接崩塌到不足1%长程任务则彻底归零。不仅如此就算拼命增加采样次数也就是让AI多试几次对于中程和长程任务的成功率也几乎没有改善。这个结果揭示了长程序列决策中一个严酷的规律错误会累积和放大。在短程任务里走错一步还有机会纠正但在长程任务里早期的一个错误决策就像骨牌一样引发后续一连串错误把整个规划彻底带偏。这与人类经验相通——学厨时如果反复被教导用错了某种切法这个坏习惯在简单菜肴里影响还不大但做复杂大菜时就会在关键节点上造成不可挽回的失误。研究团队同时发现多样化的最优规划模式比如同样是完成任务但思维推理的格式写法不同并不会互相干扰——4种不同格式的最优轨迹和1种最优轨迹相比效果几乎一样好。所以问题的关键不在于格式是否统一而在于决策是否正确。五、后训练阶段强化学习能帮AI更上一层楼吗在打好预训练基础之后研究团队转向了第二阶段用强化学习RL来进一步提升规划能力。这就像厨师学徒在学完基础知识之后通过参加烹饪比赛来进一步磨砺技艺——比赛会给出明确的成败反馈帮助选手找到最优策略。研究团队引入了两种核心概念的区分这个区分非常关键规划模式Planning Pattern和规划知识Planning Knowledge。规划模式是指通用的、跨任务可复用的思维框架类似于厨师学会了先检查食材再开始烹饪这个通用习惯不管做哪道菜都适用。规划知识则是任务特定的具体程序性知识类似于做红烧肉必须先焯水再下锅这样的具体菜谱换了另一道菜就用不上了。用信息论的视角来理解规划模式与具体任务的关联度较低互信息低不同任务共享相同的规划模式规划知识与具体任务的关联度非常高互信息高每个任务需要的知识各不相同。这个区别决定了强化学习能做什么、不能做什么。六、后训练阶段强化学习的有效区域与边界研究团队把强化学习的适用范围划分成三个区域就像地图上的不同地形一样。第一个区域叫不必要区域当预训练数据质量很高接近全部最优轨迹且任务的规划步骤较短时不同规划模式的表现本来就差不多好强化学习无法带来明显提升——这就像已经考了满分再怎么刷题也没意义。第二个区域叫有效区域当预训练数据质量中等混有一部分次优轨迹且任务步骤适中时强化学习能够有效地从混乱的预训练数据中淘金找出并强化那些期望回报更高的规划模式——这才是强化学习真正发挥价值的地方。第三个区域叫不支持区域当预训练数据质量很差且任务步骤非常长时强化学习自身也力不从心了。研究团队比较了两种主流的后训练算法GRPO一种基于最终结果奖励的强化学习方法类似于只根据菜肴最终是否好吃来给厨师评分和OPD在线策略蒸馏一种让学生实时模仿优秀教师的方法类似于让学生的每一个切菜动作都在教师的指导下完成。在有效区域里OPD比GRPO有更宽的适用边界。特别是当预训练数据质量差、任务步骤长时OPD仍然能带来显著提升而GRPO却往往失效。原因在于GRPO使用的是稀疏奖励——只在任务最终成功或失败时才给出反馈这就像厨师做了一桌子菜只告诉他整体好吃或整体难吃却不说具体哪道菜有问题。在长程任务里一个长序列中的正确动作和错误动作全都混在一起这种粗糙的奖励信号很容易把好的动作和坏的动作都给强化了或都给惩罚了产生混乱的梯度更新方向。OPD则不同它在每一个生成的词token上都提供实时的模仿信号就像教师在厨师每一个操作环节都给出指导信号更密集、更精准。研究团队通过一种叫奇异值分解方向分析的技术手段直观地证明了这一点他们追踪了模型参数在训练过程中的更新方向发现在短程高质量设置下GRPO的梯度方向相对一致但随着任务变长、数据质量下降GRPO的梯度方向越来越混乱甚至出现梯度消失即几乎没有更新模型停滞不前的情况。OPD的梯度方向则始终保持较高的一致性说明每次更新都在朝着正确方向努力。然而OPD也有自己的局限它倾向于让模型直接复制教师的规划模式这减少了模型输出的多样性熵降低了从而压低了passk随k增大时的改善空间。GRPO在有效区域内虽然提升幅度和OPD相近但它保留了更多多样性在多次采样时表现出更高的上限——换句话说GRPO更有机会偶然走出一条非常好的路而OPD则让模型老老实实地跟着教师走不太会走出意外之喜的路线。七、后训练阶段规划知识的蒸馏为什么会失败接下来是一个非常微妙但极其重要的发现并不是所有东西都适合用OPD来传授。研究团队设计了一个实验同一个目标物品比如羊毛存在两条完全不同的合成路径——路径A是用水、草种和小羊来合成路径B是用水、棉籽和纺纱机来合成。研究团队分别训练了掌握路径A的教师A和掌握路径B的教师B然后尝试用教师B来训练一个预先学了路径A的学生模型学生A。教师B本身的表现完美——在所有任务上成功率高达100%。按照直觉这么优秀的教师应该能把学生教得很好。然而实验结果相当令人意外用教师B指导的学生A其在中等难度任务上的avg8从教师A指导时的42.19%骤降至6.09%pass8更是从51.25%暴跌至7.50%。不仅没有提升反而比原来更差了甚至比根本没经过后训练的基础模型还要差这种失败的根本原因在于规划知识所具有的高互信息特性。由于学生模型在预训练中已经把路径A的合成规则深深编码进了参数里它的世界模型是围绕路径A建立的。当教师B按照路径B给出指导时在学生A看来教师B的很多正确步骤在它自己的世界模型框架内是错误的——因为路径不同步骤之间的逻辑关系就不同。OPD会把教师的指导信号当作学习目标强行把学生往路径B的方向拉结果破坏了学生原有的路径A知识却又没能完整建立起路径B的知识导致模型陷入一种两头不靠岸的中间态。研究团队用KL散度衡量两个概率分布之间差异的指标的动态变化来解释了这个过程在训练早期OPD成功地让学生模仿了教师的通用规划模式思维框架的排列方式所以初期性能有所提升但在训练后期优化目标转向了对具体规划知识的模仿而学生和教师在知识层面上存在巨大鸿沟强化学习的更新幅度太小根本不足以完整替换掉旧知识并建立新知识最终训练崩溃。这就像一位熟练掌握了法式烹饪的厨师突然被强制要求只用中式烹饪思维来理解法式食谱——他原有的法式知识被干扰了但中式知识又没来得及建立结果两者都用不好。研究团队还指出现有训练数据中几乎不包含从错误中恢复的纠错示范但这类数据至关重要。现实中AI难免会走入错误状态仅靠完美的黄金轨迹是无法让模型学会在犯错后如何重新找回正确方向的。八、多教师融合阶段向多位大师同时学习的艺术研究的第三个阶段聚焦于一个现实场景如何让一个AI模型同时从多个不同领域的专家教师那里学习获得多方面的综合能力这在现实的AI开发中已经是标准操作——包括GLM-5、DeepSeek-V4等顶级模型都采用了类似的多教师融合策略。研究团队把多教师融合MOPDMulti-Teacher On-Policy Distillation分成三种典型情景用模式兼容性和模式共享性两个维度来刻画它们之间的关系。第一种情景不同领域的教师虽然各自只精通自己的领域但它们的规划模式思维框架是兼容的且在底层存在共同的结构。实验结果表明这种情况下MOPD能实现真正的跨领域泛化——仅仅从奇幻炼金术领域的教师那里学习学生在畜牧农场领域的表现也会随之大幅提升。具体数据上以4:4次优比例预训练的学生为例仅接受炼金术教师蒸馏后畜牧农场领域的中等难度avg8就从34.92%跳升至52.58%尽管教师本人对畜牧农场的任务一无所知成功率0%。研究团队通过追踪不同规划模式在各领域的分布比例揭示了MOPD的核心机制它不是试图覆盖所有教师的所有模式而是在多个教师之间找到共同认可的规划模式然后强化收敛到这个共享分布上。这种现象在信息论中被称为mode seeking模式寻找而非mode covering模式覆盖——当多个教师都喜欢用T1目标驱动这种思维框架时学生最终会以极高的概率接近100%采用这种框架完全抛弃其他框架而不是试图在所有教师偏好的框架之间保持平衡。第二种情景当不同领域的规划模式部分兼容、部分冲突时MOPD可以支持持续学习——学生在学会新领域的同时大致保留了对旧领域的能力。研究团队观察到只要不同领域之间存在某个公共的避风港规划模式模型就能把对这个公共模式的依赖作为避免遗忘的锚点在新旧知识之间取得相对平衡。第三种情景则要危险得多当不同领域之间既不共享规划模式、模式之间又完全冲突时灾难性遗忘就会发生。具体表现是模型在学完最新领域电子组装之后最初学习的畜牧农场领域的性能从90%骤降至15.62%。原因是在没有公共模式作为缓冲区的情况下学生会对最新教师的偏好过度拟合把那个领域的捷径规划模式实际上含有大量错误当成普适策略应用到所有领域从而触发各领域中该模式对应的陷阱。研究团队还通过参数动态分析证明了MOPD的一个重要特性MOPD对模型参数的改变幅度非常小——MOPD训练后的模型与初始模型的参数距离比专业教师模型与初始模型的距离小了约150倍。这解释了为什么MOPD难以在参数变动极其有限的情况下完整地学习全新的、未曾在预训练中见过的规划知识——小剂量的更新根本不够把一套完全陌生的知识体系刻进模型参数里。九、研究成果汇总从厨房到全局视野把这三个阶段的研究结论拼在一起就形成了一张关于AI长程规划能力的完整地图。在预训练阶段最重要的三件事是让AI在内心建立关于环境运转方式的世界模型而非只背动作序列在以简单数据为主的训练集里加入少量长程演示哪怕只有5%也能激活长程规划能力以及严格控制数据质量一旦混入次优轨迹长程任务的表现就会呈指数级崩溃。在后训练阶段关键在于区分规划模式和规划知识这两类不同性质的能力。规划模式是跨任务共享的通用思维框架适合用强化学习来强化OPD在数据质量差、任务步骤长的困难场景下比GRPO有更宽的有效区域规划知识是任务特定的程序性知识强化学习对它无能为力甚至有害更适合通过监督微调SFT来注入。在多教师融合阶段MOPD能否成功取决于不同领域的教师是否共享兼容的规划模式共享且兼容则实现跨领域泛化部分共享但存在冲突则支持持续学习但有一定遗忘完全不共享且相互冲突则导致灾难性遗忘和跨领域干扰。说到底这项研究提供了一套前所未有的、系统性的视角来理解AI智能体的长程规划能力是怎样被构建起来的。它最重要的贡献不是某一个具体的技术突破而是对能力从哪里来、在哪里成形、能往哪里扩展这些基础性问题给出了受控实验下可验证的答案。对于从事AI系统开发的人来说这些结论有非常直接的实践指导价值花时间构建高质量的预训练数据尤其是世界模型格式的数据远比试图用强化学习事后弥补更有效不同任务共享规划模式是多教师融合能否成功的前提条件以及OPD虽然在困难设置下比GRPO更稳健但它压制多样性这一特点意味着对教师模型的质量要求极高。对于普通人来说这项研究背后有一个更直白的启示AI变聪明的方式和人类学习的方式其实有很多共通之处。好的基础教育预训练、有针对性的实践训练后训练、以及向不同领域的优秀导师学习多教师融合——这些在人类教育体系里反复验证过的原则在AI的训练过程中同样成立只是背后的机制在受控实验的解剖刀下第一次变得清晰可见。有兴趣进一步了解这项研究的读者可以通过arXiv编号2607.24720搜索到完整论文其中还包含实验代码、数据集和模型权重的开放获取链接供研究人员复现和扩展这些工作。QAQ1AI的世界模型内化训练方式和直接预测动作的训练方式有什么本质区别A直接预测动作的AI学的是背食谱——给定当前状态凭记忆输出下一步操作不理解为什么要这么做。世界模型内化则让AI在行动前先在内心推演目标是什么当前缺少什么合成某个中间物品需要什么前提条件这些前提是否在库存里……通过这种逐层分析AI真正理解了环境的运转规律。研究数据显示这种差异在短程任务里不明显但在长程任务9步以上中世界模型方式的成功率比直接预测高出约46个百分点因为长程任务中每一步的推理都依赖于对前因后果的完整理解而不是简单的条件反射。Q2多教师融合训练为什么有时候会导致AI忘掉之前学的东西A多教师融合MOPD的核心机制是让模型向不同领域的教师依次学习但它会收敛到各个教师共同认可的规划模式上。当不同教师之间不存在共同的规划模式且各自的规划思维方式还相互冲突时模型会对最新学习的教师过度适应把那位教师的偏好强行推广到所有领域。如果这种被强化的规划模式在其他领域里实际上是错误策略就会触发这些领域中对应的坏习惯导致旧领域的性能大幅下降。研究中的极端案例显示完全无共享且冲突的模式会让某个领域的成功率从90%暴跌至15%。Q3为什么用完美教师做在线策略蒸馏OPD训练学生的表现有时反而会变差A这种反直觉的现象发生在教师和学生拥有不同内心知识体系的情况下。当学生在预训练中已经学会了完成同一目标的路径A而教师按照路径B来指导时教师从路径B视角给出的每一步正确操作在学生路径A的世界模型框架里看起来都是奇怪的。OPD通过KL散度损失强行拉近学生和教师的输出分布这个拉扯过程会干扰学生原有的路径A知识但又因为强化学习本身每次参数更新幅度极小不足以完整建立路径B的新知识最终学生陷入旧知识被破坏、新知识未建立的混乱中间态表现反而不如训练前。
返回列表