尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

世界模型篇:三条路径最终产出什么,证据是什么

世界模型篇:三条路径最终产出什么,证据是什么 结论三条路径都预测未来但交付物不同世界模型学习环境的内部状态并预测时间推进或动作施加后状态怎样变化。[1] 三条主要路径的区别不是“是否理解世界”而是在哪里预测、预测什么、预测结果供谁使用路径预测对象最终产出主要用途能力证据隐空间动力学压缩后的潜在状态与奖励供策略搜索的内部轨迹、最终动作策略强化学习与控制在学得的模型内训练后策略能回到外部环境完成任务表征空间预测视频或动作后的抽象表征对未来状态的表征预测、规划动作视觉理解、预测与机器人规划未见环境中仅凭图像目标完成真实机械臂任务生成式环境可见画面及交互后的画面可实时导航、可交互的动态环境仿真、内容生成、智能体训练环境用户动作能改变画面环境在时间与视角变化中保持一定一致性前两条都避免逐像素重建第三条直接生成可见环境。仅能复原当前场景的三维模型没有预测状态演化不满足本文的世界模型判据。三个术语先说清潜在状态是把高维观测压成的一小串数字。它所在的空间叫隐空间。数字的维度通常没有可直接命名的物理含义需要用探针检验其中能否恢复某项信息。探针是在冻结表征上训练的小模型。AlphaEarth 把约 10 米像元的一年多源观测压成 64 维向量可作为地理空间中的近似对照。[2]隐空间动力学预测“下一串数字”不要求每一步都还原成画面。它保留足以支持奖励预测和动作选择的信息。联合嵌入预测架构JEPAJoint-Embedding Predictive Architecture是一类表征预测方法。[3] 它分别编码上下文和目标再用上下文表征预测目标表征。训练目标不要求重建像素因此可以忽略难预测但未必影响任务的像素细节。生成式环境直接产生人或智能体能看到并进入的画面。它要同时接受控制输入并在连续交互中维持场景状态。预测发生在哪里隐空间动力学状态 z(t) 动作 a(t)→ z(t1)、奖励表征空间预测上下文表征 动作→ 目标表征生成式环境当前画面 控制→ 下一幅可见画面模型内轨迹与策略未来表征与规划动作可交互动态环境路径一隐空间动力学把模型当作策略训练环境代表工作DreamerV3[4]解决什么问题。DreamerV3 要用一套固定配置处理不同控制任务并在真实试错昂贵或奖励稀疏的情况下主要依靠模型内部预测的轨迹训练策略。技术身份。项目已核实信息模型类型基于世界模型的强化学习智能体结构/基座不依赖现成语言或视觉大模型世界模型把感官输入编码成离散类别式表征预测未来表征与奖励另有 actor-critic 策略学习部分训练方式从环境交互经验学习世界模型再从想象轨迹训练策略原文未给出冻结模块的细分数据与评测超过 150 个任务包含从零开始的 Minecraft 钻石任务代码公开作者与机构Danijar Hafner、Jurgis Pasukonis、Jimmy Ba、Timothy Lillicrap论文列出的机构为 Google DeepMind、多伦多大学与 Vector Institute论文与代码Nature 论文官方代码仓库具体做法。模型把观测编码为潜在状态依据潜在状态和动作预测未来潜在状态与奖励。策略的 actor 根据状态选动作critic 估计长期回报两者主要从世界模型展开的想象轨迹学习。干完是什么样。产出不是一段供人观看的视频而是大量内部状态轨迹和一个可执行动作的策略。部署时策略接收当前状态并选动作。怎么证明具备世界模型能力。关键证据不是画面逼真而是“内部预测是否足以支持外部控制”。DreamerV3 使用世界模型生成想象轨迹训练策略同一套超参数跨 150 多个任务使用在 Minecraft 中不依赖人类数据从零开始完成挖钻石的长链条稀疏奖励任务。模型内训练得到的策略能在实际评测环境获得任务奖励说明潜在动力学保留了控制所需信息。图 1DreamerV3 官方仓库的方法图。图中世界模型接收经验并预测潜在轨迹actor 与 critic 在想象轨迹上学习。图片 URLhttps://user-images.githubusercontent.com/2111293/217355673-4abc0ce5-1a4b-4366-a08d-64754289d659.png来源页https://github.com/danijar/dreamerv3。路径二表征空间预测为真实机器人规划未来代表工作V-JEPA 2 与 V-JEPA 2-AC[5]解决什么问题。V-JEPA 2 从大规模无标注视频学习物理运动表征。动作条件版本再用少量无标注机器人交互数据后训练以便在新环境中依据图像目标规划。技术身份。项目已核实信息模型类型自监督视频编码器动作条件版本是潜在空间世界模型结构/基座JEPA上下文编码器产生表征预测器预测被遮挡或未来部分的目标表征V-JEPA 2-AC 在输入中加入动作条件训练方式先用视频做无标签自监督预训练再用 DROID 机器人视频做动作条件后训练[5]原文未给出各阶段冻结范围数据超过 100 万小时互联网视频后训练使用 DROID 中不到 62 小时无标注机器人视频评测零样本部署到两个实验室的 Franka 机械臂以图像为目标完成抓取和放置没有采集两处环境的专用数据也没有任务专用训练或奖励作者与机构Mahmoud Assran 等Meta FAIR论文与官方仓库列有完整作者论文、代码与权重论文官方代码仓库仓库提供检查点链接具体做法。预训练阶段把视频片段编码成表征并用可见上下文的表征预测目标片段的表征。动作条件后训练阶段再加入机器人动作使预测器学习“当前表征 候选动作 → 未来表征”。规划时可以比较候选动作带来的未来表征与目标图像表征选择更接近目标的动作序列。干完是什么样。普通 V-JEPA 2 输出视频表征可用于运动理解和预测V-JEPA 2-AC 输出动作条件下的未来表征用于选择机械臂动作。它不必生成供人观看的未来视频。怎么证明具备世界模型能力。证据必须包含动作条件预测和闭环任务结果。V-JEPA 2-AC 用少于 62 小时机器人视频后训练。随后系统被部署到两个没有环境专用训练数据的实验室。它以单目 RGB 图像为输入完成 reaching、grasping 和 pick-and-place。官方仓库报告的 Franka 机械臂结果为reach 100%杯子抓取 60%杯子 pick-and-place 80%。表中同时列出 Octo 与 Cosmos。[5] 因而这些不是孤立精度。图 2V-JEPA 2 官方仓库的动作条件版本示意图。它展示少量机器人数据后训练以及在新环境中用图像目标进行 reaching、grasping 与 pick-and-place。图片 URLhttps://raw.githubusercontent.com/facebookresearch/vjepa2/main/assets/vjepa2-ac-abstract-new.png来源页https://github.com/facebookresearch/vjepa2/blob/main/assets/vjepa2-ac-abstract-new.png。路径三生成式环境直接交付可进入的画面世界代表工作Genie 3[6]解决什么问题。Genie 3 接收文字提示实时生成用户可导航的动态环境并在连续交互中保持短时一致性。技术身份。项目已核实信息模型类型通用生成式世界模型结构/基座原 09 与官方说明未公开足以复述的网络结构或基座本文不推断训练方式与数据原 09 与官方说明未给出可核实细节标记为未公开/未核实输入输出文字提示加实时控制输入输出 720p、24 帧/秒的可交互动态环境连续数分钟保持一致评测/演示官方演示包含物体持久记忆和可提示的世界事件截至原 09 所述为有限研究预览作者与机构Google DeepMind官方文章署名 Jack Parker-Holder、Shlomi Fruchter项目页Google DeepMind 官方说明具体做法。可公开核实的输入输出是用户用文字描述环境并在生成环境中提供导航控制系统连续生成与控制相应的下一帧。网络结构、数据组成和训练阶段在本系列的事实来源中没有足够信息不能像 DreamerV3 与 V-JEPA 2 那样复述训练机制。干完是什么样。产出是能实时导航的画面而不是潜在状态轨迹或机器人动作。官方报告分辨率为 720p、速度为 24 帧/秒交互一致性持续数分钟用户还可用文字改变天气、加入动物或触发事件。怎么证明具备世界模型能力。单张高质量截图只能证明图像生成不能证明世界模型能力。更直接的证据是连续交互演示控制输入改变视角和环境先前物体或改动在场景切换后仍保持位置可提示事件改变后续状态。官方页面提供交互录屏这里的静态拼图只用于显示“生成结果是可导航环境”能力判断仍依据连续演示而不是截图本身。图 3Google DeepMind 官方页面的 Genie 3 环境拼图中央方向键提示这些画面可被实时导航。图片已本地化assets/genie3.png来源页https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/。三张图放在一起差异在交付物不在画面风格隐空间动力学DreamerV3表征预测V-JEPA 2-AC生成式环境Genie 3内部展开想象轨迹交付动作策略预测未来表征交付规划动作连续生成画面交付可进入环境三图不能用同一视觉指标比较。DreamerV3 的方法图说明“策略从想象轨迹学习”V-JEPA 2-AC 的机器人图说明“表征预测被用于真实动作规划”Genie 3 的环境图说明“输出本身是可导航画面”。相应的能力验证也分别是任务奖励、真实机器人成功率和交互一致性。地理空间语料中的对应位置查到中三篇位于无人机聚类WorldFly 生成未来视频并预测导航动作FlyMirage 用生成式世界模型生成飞行数据MotionScape 是面向世界模型的数据集。[7][8] 后两项本轮未找到稳定的一手页面因此只保留原 09 的标题级记录。WorldFly是原文介绍最具体的地理相关实例。[7]解决什么问题无人机在高楼遮挡和急转弯造成视角剧变时仅靠历史观测直接预测动作不稳定。具体做法用双分支流匹配同时生成未来视频和导航动作让未来视频预测为动作分支提供信息另建 Urban Canyon Traversal Benchmark。效果与限制论文报告未见环境中优势最明显。该文为 2026-06-04 预印本原系列只读摘要与引言未精读基座、训练规模、评测题量和代码开放状态在原文中没有完整记录不能据此扩展声称。作者与机构清华大学深圳国际研究生院与清华 BNRist郑晟涛等通讯陈鑫磊、李勇论文。它最接近路径三因为直接生成未来视频同时又输出导航动作因此也接近路径一的控制目标。是否达到长期一致、可交互环境的标准需要精读完整实验后再判断。判定一项工作是否真有世界模型能力遇到“world model”字样时可以依次检查状态是什么像素、潜在向量、几何状态还是只是一段文字知识变化条件是什么时间、动作或情景假设是否明确进入预测输出是什么未来状态、奖励、策略、动作还是可交互环境验证是否跨时间或动作只做当前帧分类、静态点云或问答不够。证据是否匹配路径控制路线看任务回报表征路线看预测与规划生成路线看连续交互一致性。用这五问判断VGGT 是静态几何前端不是完整世界模型普通视频生成如果没有控制条件和状态一致性证据也不能仅凭连续画面自动归入世界模型。小结隐空间动力学把预测结果交给策略训练表征空间预测把未来压缩成可用于规划的向量生成式环境把未来直接呈现为可交互画面。三条路径的共同门槛是动作或时间条件下的状态预测差异在交付物与验证方式。三个概念的总关系见《00 概览篇》。下一篇《02 空间智能篇》把这些路线放进五层能力框架。参考文献[1] Ha, D.; Schmidhuber, J.World Models. 2018. https://arxiv.org/abs/1803.10122。[2] Brown, C. F. et al.AlphaEarth Foundations: An embedding field model for accurate and efficient global mapping from sparse label data. 2025. https://arxiv.org/abs/2507.22291。[3] LeCun, Y.A Path Towards Autonomous Machine Intelligence. 2022. https://openreview.net/forum?idBZ5a1r-kVsf。[4] Hafner, D.; Pasukonis, J.; Ba, J.; Lillicrap, T.Mastering diverse control tasks through world models. 2025. https://www.nature.com/articles/s41586-025-08744-2代码https://github.com/danijar/dreamerv3。[5] Assran, M. et al.V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. 2025. https://arxiv.org/abs/2506.09985官方说明https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/代码https://github.com/facebookresearch/vjepa2。[6] Google DeepMind.Genie 3: A new frontier for world models. 2025. https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/。[7] Zheng, S. et al.WorldFly: Dynamic World Model for Aerial Navigation. 2026. https://arxiv.org/abs/2606.06147。[8] 原 09 本地标题记录FlyMirageMotionScape. 2026.链接待核实。
返回列表