LOOPED WORLD MODELS——循环世界模型
《Looped World Models》循环世界模型的核心贡献是首次将循环架构Looped Architecture应用于世界模型World Models并提出了一套完整的解决方案。以下是该研究的全面总结与概括1. 核心问题与动机当前主流世界模型如DreamerV3面临一个根本性矛盾追求高质量长时程模拟需要极深的神经网络模型越深参数越多部署成本越高且预测误差会随模拟步长指数级累积 compounding errors。作者指出传统模型为每个状态转移分配相同的计算量但物理世界中的简单状态如自由落体和复杂状态如碰撞所需计算量理应不同。2. 核心创新LoopWM论文提出了循环世界模型LoopWM其核心设计包含三个层面参数共享与迭代精炼使用一个参数共享的Transformer模块在“内循环”中迭代多次来精炼当前步的潜在状态。这使得模型在保持极小参数量约1B参数的同时拥有极深的“等效深度”。谱稳定性约束Spectral Stability为确保状态在长序列展开中不爆炸或消失作者借鉴了Parcae等研究将状态转移矩阵的谱范数约束在小于1的区间。通过数学上的负对角矩阵离散化保证了无论循环多少次潜在状态都是有界且稳定的。自适应计算深度Adaptive Computation模型可以动态决定“内循环”的迭代次数。简单的转移如物体静止可能只需1次循环复杂的转移如化学反应则分配几十次循环从而显著降低平均推理成本。3. 关键技术延迟解码Deferred Decoding为了进一步提升效率作者提出了“延迟解码”策略。现有模型如Dreamer在每个时间步都进行解码预测观测和奖励计算量大且限制潜在推理。LoopWM的做法在规划/推理时模型仅在最后一刻才进行解码输出。中间步骤全部在纯潜在空间中进行动作注入和状态演化。这种“先思考后回答”的模式类似于语言模型中的思维链CoT大幅减少了计算开销并鼓励模型学习更长时间跨度的抽象表征。4. 实验结果论文在两个文本世界环境ScienceWorld 和 AlfWorld上进行了验证性能碾压大模型仅约1B参数的LoopWM在ScienceWorld的EM精确匹配指标上达到68.4%远超闭源大模型 claude-opus-4-6-max47.2%和 Gemini-3-flash30.8%。参数效率极高实现了比传统方法高达100倍的参数效率。延迟解码有效对比实验表明随着展开步数Step 1→5增加延迟解码带来的相对提升越来越大如在Boil任务上Step 5的EM提升达500.9%证明了累积潜在推理的优势。5. 研究定位与意义作者强调LoopWM开创了世界模型的一条新扩展轴——迭代潜在深度Iterative Latent Depth。以往我们提升模型性能只能靠“增大模型”或“增加数据”而现在可以通过“增加循环迭代次数”来提升性能类似测试时计算扩展。这不仅解决了传统世界模型“深则不稳、浅则不准”的痛点也为在资源受限设备上部署高质量模拟器提供了可能。论文提出了一种超级轻量参数共享但等效极深迭代循环的世界模型架构通过数学保证稳定性和动态分配计算量用1B参数击败了数百B参数的闭源大模型。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要当前的世界模型面临一个基本矛盾忠实的长期模拟需要深度计算但更深的模型部署成本高昂且容易产生复合误差。我们通过引入循环世界模型Looped World Models简称 LoopWM解决了这个问题这是首个用于世界建模的循环架构。我们的方法通过一个参数共享的 Transformer 模块迭代地精炼潜在环境状态。这相比传统方法实现了高达 100 倍的参数效率并具备自适应计算能力能自动调整深度以匹配每个预测步骤的复杂度。与扩展模型规模和训练数据正交LoopWM 将迭代潜在深度确立为世界模拟的一个全新扩展轴这可能极大地推动该领域的发展。图 1我们提出的循环世界模型LoopWM的总体框架。1 引言世界模型WM学习根据动作预测环境如何演变。WM 已成为样本高效强化学习和具身智能的基石Ha Schmidhuber, 2018; Hafner et al., 2019; Lukasz Kaiser et al., 2020。值得注意的是深度规划网络PlaNet是一个 WMHafner et al., 2019它首次证明了智能体可以完全从像素中学习潜在动态并通过在线优化进行规划。这确立了循环状态空间模型RSSM作为世界建模的基础架构。随后Dreamer 系列模型Hafner et al., 2020; 2021; 2025逐步完善了这种方法最终推出了 DreamerV3Hafner et al., 2025。DreamerV3 使用单一超参数集精通超过 150 个不同任务。为了利用 Transformer 的强大表示能力后续工作替换或增强了循环主干网络。IRISMicheli et al., 2023表明基于离散潜在令牌的自回归 Transformer 可以作为一个高度数据高效的世界模型。TransDreamerChen et al., 2022为需要长程记忆的任务引入了 Transformer 状态空间模型。Δ-IRISMicheli et al., 2024通过上下文感知的增量令牌化提高了效率。DIAMONDAlonso et al., 2024展示了扩散模型可以生成视觉逼真的世界模拟而 EMERALDBurchi Timofte, 2025通过结合掩码生成 Transformer 与空间潜在状态在 Crafter 任务上取得了最先进的性能。在更大规模上SoraOpenAI, 2024和 GenieBruce et al., 2024; Google DeepMind, 2025展示了视频生成模型和生成式交互环境可以作为通用世界模拟器。多项综述调查了世界模型在自动驾驶Feng et al., 2025、具身 AILi et al., 2025b和视频生成Dewi Puspitasari et al., 2024; Wang et al., 2026等领域的快速扩张。尽管取得了这些进展但忠实的长期模拟通常需要深层或迭代计算。这是因为物理动态是通过反复应用控制定律展开的而传统的固定深度架构无论转换的难易程度如何都为每个转换分配相同的计算量。存在两种典型的失效模式。首先预测误差会导致轨迹质量在长时间的展开步骤中迅速下降Xiao et al., 2020; Talvitie, 2017; Luo et al., 2022。其次为应对这种退化而按比例缩放模型深度通常会增加参数数量和推理成本这使得在资源受限的平台上进行实时部署变得极其昂贵Feng et al., 2025; Hafner et al., 2025。一个并行的研究方向探索了循环 Transformer 架构LM。在 LM 中一组共享的 Transformer 模块被循环地应用于相同的潜在表示。这一概念最早由通用 TransformerUniversal Transformer提出Dehghani et al., 2019它引入了跨层权重共享和受自适应计算时间Graves, 2016启发的自适应停止机制。早期理论工作表明LM 可以用恒定的参数数量模拟任意迭代算法包括梯度下降、牛顿法和动态规划Giannou et al., 2023并且它们在使用少于 10% 参数的情况下达到了与标准 Transformer 相当的上下文学习性能Yang et al., 2023。ALBERTLan et al., 2020展示了跨层参数共享在语言表示学习中的实际可行性。MoEUTCsordás et al., 2024将混合专家模型与通用 Transformer 相结合。最近循环架构已被扩展到实际的语言模型中并取得了有希望的结果。Zhu 等人2025证明循环语言模型可以通过迭代潜在计算实现约 2 到 3 倍的参数效率。Geiping 等人2025表明循环深度模型可以通过在推理时简单地增加循环迭代次数来扩展测试时计算。Fan 等人2024证明带有自适应停止的循环 Transformer 能显著改善长度泛化能力。Saunshi 等人2025从理论和实验上证明循环模型能够隐式地生成潜在思考。Jeddi 等人2026引入了带有快捷调制shortcut modulation的弹性深度训练用于预算条件下的潜在推理。Bae 等人2025提出了在单个递归 Transformer 内为每个令牌动态分配递归深度。Prairie 等人2026通过将循环前向传播重新解释为残差流上的非线性动力系统并使用负对角参数化约束状态转移矩阵的谱范数解决了循环模型的训练不稳定性问题。最近Hyperloop TransformersZeitoun et al., 2026通过矩阵值超连接残差流增强了循环模块在参数数量减半的情况下性能超过了深度匹配的标准 Transformer。这些发展将循环 Transformer 与更广泛的深度连续和隐式层模型家族联系起来包括神经常微分方程Neural ODEsChen et al., 2018和深度均衡模型Deep Equilibrium ModelsBai et al., 2019它们同样迭代一个共享函数以达到不动点。然而上述所有循环架构的工作都仅在语言建模的背景下开发和评估。循环世界模型LoopWM则完全未被探索。实际上循环架构的参数效率对于世界模型具有独特价值因为长时程展开需要将动力学模型按顺序执行数百或数千次一个以少量参数达到更大网络预测质量的模型将在每个展开步骤中产生复合节省。此外循环模型的自适应深度特性——为复杂转换如碰撞、接触事件分配更多迭代为简单动态如自由飞行分配更少迭代——直接映射到物理模拟的非均匀计算需求。在最有利的情况下即简单状态转换仅需单次循环迭代而传统固定深度模型需要完整的前向传播时这种自适应机制相对于固定深度基线可以大幅降低平均推理成本。减少的幅度取决于转换难度的分布、最小有效循环深度以及退出机制的开销。在这项工作中我们引入了循环世界模型LoopWM这是首个用于环境模拟和动态预测的循环 Transformer 架构。我们的方法结合了一个参数共享的循环 Transformer 模块和谱约束残差动态使得在任意展开长度下都能实现可证明稳定的状态转移。我们证明循环世界模型在使用显著更少参数的情况下达到了与现有世界模型架构相当或更优的预测精度在更长的时间范围内保持了稳定的展开并支持测试时自适应计算能自动将计算深度与转换复杂度匹配。我们还集成了残差连接以提升模型性能。我们的结果将迭代潜在深度确立为世界模型的一个前所未有的、高效的扩展轴它正交于模型规模和训练数据。2 相关工作2.1 用于强化学习和具身智能的世界模型学习环境动态内部模型的思想可以追溯到认知科学和控制理论中关于心理模拟和前向模型的早期工作。在深度强化学习中Ha Schmidhuber2018提出使用变分自编码器和 RNN 学习环境的压缩时空表示并在学习到的“梦境”中完全训练一个紧凑的策略。PlaNetHafner et al., 2019通过一个潜在动态模型RSSM将其形式化该模型直接从像素观测中在潜在空间进行规划。SimPLeŁukasz Kaiser et al., 2020通过训练一个视频预测模型作为学习到的模拟器展示了基于模型的 Atari 游戏玩法。MuZeroSchrittwieser et al., 2020表明即使无法访问真实规则结合蒙特卡洛树搜索的学习动态模型也能掌握棋盘游戏和 Atari 游戏。Dreamer 家族Hafner et al., 2020; 2021; 2025逐步完善了基于 RSSM 的世界模型最终推出了 DreamerV3Hafner et al., 2025它使用单一超参数集在超过 150 个不同任务上达到了人类水平的性能。随后出现了基于 Transformer 的世界模型IRISMicheli et al., 2023用基于离散令牌的自回归 Transformer 取代了循环主干网络TransDreamerChen et al., 2022为记忆密集型任务引入了 Transformer 状态空间模型Δ-IRISMicheli et al., 2024通过上下文感知的增量编码提高了令牌化效率DIAMONDAlonso et al., 2024利用扩散模型生成视觉逼真的世界模拟EMERALDBurchi Timofte, 2025通过对空间潜在状态使用掩码生成 Transformer在 Crafter 任务上取得了最先进的性能。在更大规模上视频生成模型已被视作世界模拟器。OpenAI 的 SoraOpenAI, 2024展示了具有涌现 3D 一致性的长视频生成而 GenieBruce et al., 2024和 Genie 3Google DeepMind, 2025表明文本条件生成模型可以产生可交互、可探索的环境。一些综述调查了世界模型在自动驾驶Feng et al., 2025; Guan et al., 2024、具身 AILi et al., 2025b和视频生成Dewi Puspitasari et al., 2024; Wang et al., 2026领域的快速扩张。所有这些方法面临的一个持续挑战是复合预测误差每个展开步骤中的小误差会随着时间推移呈指数累积降低轨迹保真度Xiao et al., 2020; Talvitie, 2017; Luo et al., 2022。已经提出了各种缓解策略包括短时域重新规划、自校正模型Talvitie, 2017和物理信息架构Li et al., 2025a; Wang et al., 2025但计算深度与展开稳定性之间的基本矛盾仍未得到解决。2.2 循环和循环深度 Transformer 架构循环 Transformer 在深度方向上重用一组共享的 Transformer 模块将有效计算与参数数量解耦。通用 TransformerDehghani et al., 2019首次提出了这一想法结合了权重共享与自适应计算时间ACTGraves, 2016来实现输入依赖的停止。ALBERTLan et al., 2020展示了在 BERT 规模模型中全面跨层参数共享的实际可行性。随后的理论分析确立了循环 Transformer 的计算能力。Giannou 等人2023证明循环 Transformer 可以模拟任意程序作为具有恒定参数数量的可编程计算机运行。Yang 等人2023表明循环 Transformer 在使用少于 10% 参数的情况下达到了与标准 Transformer 相当的上下文学习性能。Fan 等人2024通过自适应循环次数展示了显著的长度泛化改进。Saunshi 等人2025从理论和实验上证明循环模型能隐式生成“潜在思考”使其能够推理超出其表观深度。在实际规模上OuroZhu et al., 2025通过完整的现代 LLM 流程预训练、指令微调和 RLHF训练了循环语言模型LoopLMs通过熵正则化自适应计算实现了 2-3 倍的参数效率。Geiping 等人2025表明循环深度模型RDMs通过在推理时增加循环次数来扩展测试时计算并遵循可预测的质量提升。Pappone 等人2025分析了循环深度 Transformer 中潜在动态的几何结构识别出快内循环和慢跨令牌动态的双尺度结构。LoopFormerJeddi et al., 2026引入了带有快捷调制的弹性深度训练用于预算条件下的推理。Mixture-of-RecursionsBae et al., 2025提出了在单个递归框架内为每个令牌动态分配深度。MoEUTCsordás et al., 2024将混合专家模型与通用 Transformer 相结合以平衡专业化和共享。2.3 自适应计算与提前退出为不同复杂度的输入分配不同的计算量已在多个范式中得到研究。Graves2016为 RNN 引入了自适应计算时间允许每步做出停止决策。提前退出文献Teerapittayanon et al., 2017; Bolukbasi et al., 2017; Jyoti Bajpai Hanawal, 2025使得当置信度足够高时推理可以在中间层终止。在循环 Transformer 的背景下自适应深度采取了一种特别自然的形式模型可以在任意次数的循环迭代后停止。OuroZhu et al., 2025引入了熵正则化提前退出当令牌的预测熵降至学习阈值以下时该令牌退出循环。Geiping 等人2025使用随机深度采样泊松分布循环次数进行训练以增强对可变测试时深度的鲁棒性。LoopFormerJeddi et al., 2026在训练期间以连续“时间预算”为条件使得在推理时能够进行细粒度的计算分配。Pappone 等人2025提出了基于隐状态二阶差分的加速退出规则。对于世界模型而言自适应计算尤其具有吸引力简单的状态转移如自由飞行、静态场景只需最少的处理而复杂事件如多体碰撞、接触动力学则需要更深的迭代精炼。据我们所知此前没有工作提出将自适应深度循环架构用于世界建模。3 循环世界模型LOOPED WORLD MODEL我们提出循环世界模型这是一种潜在动态架构结合了循环 Transformer 的迭代计算与世界建模所需的动作条件状态预测。我们的设计遵循三个原则(i) 模型计算图与物理动态的迭代性质在结构上对齐(ii) 潜在状态转移在任意展开长度下的可证明稳定性(iii) 与每次转移复杂度匹配的自适应计算深度。我们描述总体架构§3.1、稳定的循环动态核心§3.2、训练目标§3.3以及推理的自适应提前退出机制§3.4。3.1 总体架构3.2 具有谱稳定性的循环动态核心动态核心是我们架构的核心。遵循前奏-循环-尾声prelude-recurrent-coda设计Geiping et al., 2025; Prairie et al., 2026; Zeitoun et al., 2026我们将动态核心划分为三个模块3.3 训练目标3.4 用于推理的自适应提前退出在推理时循环动态核心可以对收敛快的转移自适应地提前终止内循环并为复杂转移分配额外的迭代。我们通过一个轻量级退出门来实现这一点它是一个单层 MLP 后接一个 sigmoid 函数3.5 延迟解码基于动作的潜在展开3.5.1 动机最近在语言建模方面的工作表明将解码推迟到潜在推理过程结束时——允许模型编码、思考然后解码——能显著提高推理质量Koishekenov et al., 2026; Geiping et al., 2025; Saunshi et al., 2025。MuZeroSchrittwieser et al., 2020同样完全在潜在空间内操作没有观测重建仅预测价值、奖励和策略。Dreamer 自身的“想象力”展开Hafner et al., 2020在不重新编码真实观测的情况下传播潜在状态但仍然在每一步应用奖励和价值预测头。我们提出延迟解码Deferred Decoding这是对循环世界模型的一种修改在多步展开中消除所有中间观测解码。给定一系列真实或规划的动作模型将每个动作注入循环动态核心并仅在连续的隐藏空间中推进潜在状态。观测、奖励和继续预测仅在最后一步产生这减少了计算量并鼓励潜在轨迹编码时间上扩展的、与动作相关的结构而非每步的视觉细节。3.5.2 公式化描述3.5.3 延迟解码的训练目标训练延迟解码变体要求模型在 K 个动作条件的转移中在没有中间重建监督的情况下保持准确的潜在表示。我们定义了一个终端预测损失和一个潜在轨迹正则化器。3.5.4 关于延迟时域 K 的课程学习3.5.5 推理模式延迟解码自然支持两种推理模式3.5.6 与先前工作的关系表 1 总结了关键区别表 1世界模型架构中中间解码策略的比较。方法潜在动态中间解码动作注入循环深度Dreamer (Hafner et al., 2020)RSSM每步奖励价值每步–MuZero (Schrittwieser et al., 2020)学习到的 MLP每步策略价值奖励每步–PlaNet (Hafner et al., 2019)RSSM每步重建每步–ETD (Koishekenov et al., 2026)循环层仅在末端解码– (语言)✓NE-Dreamer (Bredis et al., 2026)RSSM每步嵌入对齐每步–LoopWM-DD (ours)循环 Transformer仅在步骤 K 解码潜在空间每步✓Dreamer 的想象力展开已经避免了重新编码真实观测但仍然在每个想象的步骤应用奖励和价值头Hafner et al., 2020。MuZero 完全摒弃了观测重建但使用非循环的、固定深度的动态函数Schrittwieser et al., 2020。ETDKoishekenov et al., 2026展示了用于语言推理的“编码-思考-解码”范式但未处理动作条件状态转移或环境模拟。我们的延迟解码统一了这些见解它在潜在空间的每个动作步骤应用循环 Transformer 的迭代精炼继承了 LoopWM 的参数效率和谱稳定性同时将所有观测空间的计算推迟到终端步骤从而在潜在动态推理内循环外循环和观测接地单次终端解码之间实现了清晰的分离。4 结果4.1 在 ScienceWorld 上的主要结果表 2 展示了我们的模型与 claude-opus-4-6-max 在 ScienceWorld 数据集上的对比结果。从结果可以清楚地看出我们的模型超越了强大的 claude-opus-4-6-max。在最极端的情况下它将 Lifespan 任务的得分从 0% 提升到 100%表明了我们模型的强大内在能力。平均而言我们的模型展示了有前景的能力在 EM 指标上明显超过基线 21.2%在其他指标上也明显领先。此外我们注意到我们的模型是一个大约 1B 参数的小型 AI 模型远小于那些强大的闭源 API 模型如 claude-opus-4-6-max其规模大超过 100 倍。这表明我们提出的模型具有很有前景的参数效率可部署于下游应用。请注意表 3 展示了更多基线得出了相同的结论。我们还注意到qwen-3.5-flash 和 gemini-3-flash-preview 在大多数指标上似乎明显差于其他基线和我们的模型。这是合理的因为它们被认为是较小的基线模型。我们提出的模型仍然具有竞争力并且在各项指标上远强于它们。4.2 在 AlfWorld 上的主要结果表 4 展示了在 AlfWorld 数据集上的评估结果。在这个数据集上趋势依然令人鼓舞因为我们提出的模型在模型尺寸很小约 1B 参数的情况下给出了有前景的整体结果。值得注意的是它在四个模型中取得了最佳的 BLEU 分数Papineni et al., 2002并在 EM 和 Token F1 上排名第二。此外通过检查详细的行动类别我们发现我们的模型似乎在实体得分上较低并且这在大多数动作类别中似乎都是有效的。这种误差分析表明未来的优化可以专注于实体得分以进一步增强模型。表 2我们提出的循环世界模型与 claude-opus-4-6-max (Anthropic, 2026) 在 ScienceWorld 数据集 (Wang et al., 2022) 世界建模任务上的比较。准确率是基于连续输入五个动作并获取世界建模的最终分数计算的。请注意我们的模型是一个约 1B 参数的模型。更多基线请参考表 3。4.3 关于延迟解码的深入分析综合各表我们得出结论延迟解码是有用的并且当展开步骤累积时它往往更有用。5 结论我们提出了循环世界模型Looped World Models这是循环 Transformer 架构在世界建模中的首次应用。我们的方法解决了当前世界模型中的一个核心矛盾生成忠实的长期模拟需要深度计算而更深的模型会带来高昂的部署成本并且容易受到复合展开误差的影响。通过使用带有稳定残差动态的参数共享 Transformer 模块迭代地精炼潜在环境状态LoopWM 在结构上镜像了物理系统中固有的递归性同时保持了紧凑的参数规模。实验表明LoopWM 在不牺牲预测质量的情况下相比传统方法实现了高达 100× 的参数效率。理论上我们证明了状态转移上的谱范数约束能够产生可证明稳定的展开这提供了标准自回归世界模型所缺乏的形式化保证。此外我们的自适应计算机制自动调整模型的有效深度以匹配每个预测步骤的复杂性为动态上具有挑战性的转移分配更多的精炼迭代为可预测的转移分配更少的迭代。除了本文报告的具体结果外我们相信这项工作将迭代潜在深度确定为世界模拟的一个新的扩展轴它正交于模型规模和数据量的传统轴。我们希望这一视角为构建同时在更长时域上更有能力、更高效、更稳定的世界模型开辟新的方向。表 3ScienceWorld 数据集 (Wang et al., 2022) 世界建模任务的基线结果。准确率是基于连续输入五个动作并获取世界建模的最终分数计算的。请注意我们的模型是一个约 1B 参数的模型。6 更广泛的影响虽然本文已经为 LoopWM 的有效性提供了强有力的证据但当前手稿在披露范围上是有意选择性的。在这个版本中我们的目标是确立核心架构论点即循环潜在精炼、延迟解码和稳定动态共同定义了一个可行的、有前途的世界模型设计空间而不是详尽地展示我们已获得的每一个支持性结果。首先本文已经通过延迟解码展示了迭代潜在计算的价值这为在展开步骤中保留和精炼潜在计算是有益的这一观点提供了具体证据。我们认为这是循环设计的一个直接且有意义的体现。同时它只是进入更广泛证据体系的一个可见入口点这些证据支持循环的有效性并且可以在未来进行更明确的分解分析来披露这些收益。其次虽然本文强调了报告的主要任务领域但我们的实证验证并不仅限于这些设置。我们也在连续的视觉环境中验证了优化是可行的并且训练损失始终可以降低这支持了所提架构在本文强调的环境之外的实用性。因此现阶段的主要限制并非缺乏实证支持而是手稿尚未完全展示已完成的验证广度。第三LoopWM 最好被理解为更广阔的世界模型图景中的一个独特点。本文明确指出其侧重点与主要的现有家族包括 RSSM 风格的潜在动态模型、自回归视频令牌世界模型和基于扩散的世界模型不同。更明确的定位分析将进一步凸显这种区别并使贡献更易于解读。因此我们认为更直接地将 LoopWM置于这些家族中并阐明迭代潜在深度是最自然扩展轴的机制具有明确的价值。最后我们目前的步骤 1 到步骤 5 的实验已经表明迭代潜在深度表现为一个有意义的扩展维度我们认为这是本工作的核心意义之一。剩余的局限并非这种缩放趋势是否存在而是本文未能在更广泛的任务和计算范围内提供更完整的缩放律特征描述。同样从优化的角度来看我们的经验表明训练可以受益于课程学习等工程策略这些策略逐步解锁架构的能力。我们认为这不是方法的弱点而是使新的架构体系能够在规模上可靠训练的实际配方的一部分。总体而言当前论文的主要局限在于表述范围而非概念或实证基础。本文确立了 LoopWM 的核心案例而更广泛的跨家族定位、更丰富的缩放分析以及更广泛的优化细节披露可以在未来进一步加强这一论述。表 4我们提出的循环世界模型与 claude-opus-4-6-max (Anthropic, 2026) 及其他基线在 AlfWorld 数据集 (Cote et al., 2018) 世界建模任务上的比较。准确率是基于连续输入五个动作并获取世界建模的最终分数计算的。请注意我们的模型是一个约 1B 参数的模型。