尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

【多篇论文阅读】Interactive World Models

【多篇论文阅读】Interactive World Models Vid2World: Crafting Video Diffusion Models to Interactive World Models类型判断改造原理/配方不是从零新架构。本质是给已有双向 video Diffusion 补两样能力——只能看过去、能跟帧级 action 走。题目: Vid2World: Crafting Video Diffusion Models to Interactive World Models时间: 2025.05单位: Tsinghua University; Chongqing University英文关键词: video Diffusion transfer, causalization, causal action guidance1段话总结论文干了什么把互联网预训练的全序列 video Diffusion实验用 DynamiCrafter改成可逐步自回归、按 action 反事实推演的 interactive world model。配方就两步结构训练目标因果化帧级 action 注入 独立 dropout从而在逐步 rollout 时做 classifier-free action guidance。存在问题领域 world model 数据贵、画质粗现成 video Diffusion 画质好但双向看未来、条件通常是整段文本既不能在线交互也不能精细控每一步 action。解决方法原理Video Diffusion → Interactive World Model Causalization Action Conditioning。Causalization结构temporal attention 加因果 mask非因果 temporal conv 不用简单 shift会错位而用 mixed weight transfer——时间维对齐位置保留原权重多出来的“过去侧”位置用核均值初始化尽量保住预训练。Causalization目标训练用 Diffusion Forcing每帧独立噪声水平对齐推理时「历史干净、只去噪当前帧」。Action每个 action 经轻量 MLP 对齐到对应帧训练时每个 timestep 的 action 独立以概率 p 置 ∅逼模型同时学有/无最新 action 的 score推理用ε(1λ)ε_cond−λ ε_uncond做 Causal Action Guidance。相比其他方法的创新之处把「被动全序列 Diffusion → 交互 world model」拆成可操作的两段改造并给出保权重的 conv 迁移与面向逐步交互的 action CFG不是再挂一个 ControlNet/adapter 了事。基于前人的哪些方法DynamiCrafter作为被改造的预训练 video Diffusion 底座继承其互联网视频先验。Diffusion Forcing直接采用其「每帧独立噪声」训练方式使全序列 Diffusion 能做自回归 rollout。Classifier-free guidance把 CFG 从类别/文本条件延伸到因果逐步生成下的「最新一帧 action」条件。实验exp1:设置RT-1 上同底座 transfer 后做视频预测含 NAR / 自回归数据RT-1结论画质与相似度明显强于其他 transfer自回归也可稳定逐步生成exp2:设置CS:GO 上与 DIAMOND 比 16 帧 action-conditioned 预测数据Dust II 人类对局 holdout结论FVD/FID 大幅领先说明改造后的 video Diffusion 可当高保真游戏 world model提到的同类工作Genie(2024): 无标视频学可控环境DIAMOND(2024): 自回归 Diffusion 游戏 world modelAVID(2024): 冻结 video 模型上 action adapterDiffusion Forcing(2024): 分帧噪声支撑 AR Diffusion相关性最高的工作Diffusion Forcing(2024)DIAMOND(2024)AVID(2024)MIRA: Multiplayer Interactive World Models with Representation Autoencoders类型判断完整新模型系统大规模数据开源。该记清三段结构Representation Codec → Latent DiT World Model → 四人 tile 条件以及「多人」到底多在哪。题目: MIRA: Multiplayer Interactive World Models with Representation Autoencoders时间: 2026.07单位: General Intuition; Kyutai; Epic Games英文关键词: multiplayer world model, representation autoencoder, Rocket League1段话总结论文干了什么在 Rocket League 上做四人、强物理交互的实时 world model四视角四路 action 联合进 latent Diffusion单卡 B200 约 20fps约 1 万小时 bot 数据与代码开源。核心不是“多加几路输入”而是在共享场景里把变化正确归因到对应玩家并跨视角一致。存在问题多数 world model 单 agent其他人当环境纹理多人设定下易误归因、忽略某玩家、纠缠多人效果像素空间又慢又难学动力学。解决方法模型结构三块CodecRepresentation Autoencoder冻结 DINOv3-L 多中间层聚合 → 线性 bottleneck空间↓2×2、时间↓2→10Hz、通道→32→ 时空 ViT decoder空间全注意、时间因果先空间上采样再注意。重建L1LPIPSP-DINO。世界模型只在 latent 上预测。Latent World Modelflow-matching DiT因子化时空 attentionDiffusion Forcing每帧独立 τ抗自回归漂移PSD/shortcut 式 few-step 蒸馏到 1–2 步实时action 与 τ 经 AdaLN。Multiplayer四玩家 latent 沿高度 tile空间 attention 一次跨四视角各玩家键盘 action 分路 embed 后按固定顺序拼进条件广播到所有位置让模型自己学“谁的操作影响谁的画面”训练 action dropout。先单玩家预训练再 warm-start 四人优于直接四人训。推理真 clip warmup → 固定长度 rolling window KV cache每 latent 解出 2 帧 → 20fps。相比其他方法的创新之处把 multiplayer 从“单控接口看多人画面”推到「四路 action 同时条件 四视角联合生成」的强物理 3D 竞技设定系统消融证明预训练表征 latent、Forcing、二人阶段迁移的必要性用 physics probe 测动力学而不只看脸。基于前人的哪些方法Representation Autoencoder / DINOv3用冻结自监督特征建可重建、又利于动力学预测的 latent作为 WM 的预测空间。DIAMOND 路线的 latent Diffusion 游戏 WM继承「在压缩空间里做 action-conditioned 下一帧」的实时游戏模拟范式扩展到四人。Diffusion Forcing用于训练期混合干净/带噪历史降低自回归误差累积。Shortcut / consistency 类蒸馏把多步 flow 压成 1–2 步支撑实时。实验exp1:设置5B 四人模型按四路 GT action 长程 rollout测分布质量、物理 probe、可控性、实时性数据~10k hours Rocket League bot 对局结论单卡实时约 20fps跨视角事件一致物理读出与真值可对齐分布质量至少稳到测过的 5 分钟实践可小时级不塌提到的同类工作DIAMOND(2024): 单玩家实时游戏 WMGenie / Genie 3(2024/2025): 可控生成环境WHAM(2025): 四人对局数据条件仍是单玩家控制MultiWorld 等(2026): 多智能体条件场景动力学通常更弱相关性最高的工作DIAMOND(2024)Genie(2024)WHAM(2025)Infinite Worlds with Versatile InteractionsLingBot-World 2.0 / Infinity类型判断系统升级 ABC 组合。相对 1.0拼的是更稳的因果预训练MoBA 实时蒸馏consistencyDMD 更富交互数据/动作 Director–Pilot agentic harness。重点记「组合了什么、各块改了什么」。题目: Infinite Worlds with Versatile Interactions时间: 2026.07单位: Robbyant / LingBotHao Ouyang 等英文关键词: causal world model, long-horizon anti-drift, agentic harness1段话总结论文干了什么开源交互世界模型升级版因果 DiT 骨干拉长程不漂再蒸馏出 720p60fps 实时学生动作从导航扩到攻击/弓箭/法术/射击与文本改环境外挂 VLM Director 视频 Pilot让模型能持续规划角色行为并往世界里塞新事件提供 14B 与单卡 1.3B。存在问题自回归误差反馈多数只能稳秒到分钟高保真交互算力贵常砍分辨率/帧率/控制纯生成器不会“自己玩、自己补内容”。解决方法组合清单数据引擎第一人称 游戏/UE 合成 网页视频 → 技术分VLM profiling → 全局 caption chunk 多轨局部标注运动/交互/环境对齐推理时随时间变的条件。预训练新骨干 trick因果 flow matching相机 PlückerAdaLNchunk-wise prompt。MoBA mask在 teacher forcing 上拼一块双向 attention减轻“越看历史越偷懒、画质崩”的过拟合同时保留 AR 能力cross-attn 对应下三角防未来泄漏。后训练实时抗漂consistency distillation 压步数DMD 在长self-rollout分布上对齐专门打累积漂移。Agentic harness组合创新点VLM 当 Director 出 event proposalDiT 当 Pilot 落地物理/像素支持直接语义交互、SAM 跟踪物体交互、文本注入天气/实体。部署编译/并行/异步 VAE、时空 refiner、动态 KV、多玩家 UI。相比其他方法的创新之处把“能生成”升级成“能长住 能实时 能被 agent 驱动续写”MoBA 与 self-rollout DMD 针对长程漂在 world model 里系统引入 coding-agent 式 harness。宣称通用域 hour-level 且开源较稀缺。基于前人的哪些方法LingBot-World 1.0直接升级的前代开源交互世界系统数据/因果生成/实时交互骨架。Causal flow-matching DiT作为可 action/prompt 条件的世界骨干训练范式。Consistency distillation把多步教师压成少步实时学生。DMD用分布匹配继续提保真并在本文里接到长 self-rollout 上抑漂移。实验exp1:设置蒸馏实时模型与主流交互 WM 比画质、长程稳定、实时与交互丰富度并做约 1 小时不间断会话数据自建混合交互场景结论画质达最强闭源量级且开源720p60fps 量级实时小时级 rollout 无明显全程崩坏提到的同类工作Genie 3(2025): 强闭源交互世界LingBot-World(2026): 前代Matrix-Game 3.0 / HY-World 1.5(2025/2026): 游戏或通用交互生成HappyOyster: 闭源对照相关性最高的工作LingBot-World(2026)Genie 3(2025)Matrix-Game 3.0(2026)StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation类型判断完整新模型结构小规模配套数据。该记清视觉专家 状态专家 joint attention状态用回归而不是套 flow matching。题目: StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation时间: 2026.07单位: Tencent; NTU; NUS; A*STAR英文关键词: game mechanics, state-aware, Mixture-of-Transformers1段话总结论文干了什么在 Street Fighter 3 上做 state-aware game world model除画面外显式预测 timer / 双方 HP / 气条并用状态信息约束出画减少 0 血还打、气不满放大招等规则违规。配套采了 state–frame–action 对齐的 1 万段 5s 数据。存在问题现有 game WM 多在像素上学“看起来像”内部规则状态难从画面可靠推出生成常违反 mechanics缺公开的状态同步数据与耦合设计。解决方法模型结构底座 Wan2.2-TI2V-5B 视觉分支~5Bflow matching 轻量状态分支~0.76B。两侧各自 self-attn中间joint attentionMoT 式画面 query 状态用规则信息导生成状态 query 画面用视觉动态助状态推演。Action 投影后同时加进两支文本NPC 策略进视觉 cross-attn。损失视觉 flow matching 状态 Smooth L1 回归状态低维、规则硬不适合乱加噪的 FM再加权求和。推理给首帧状态后续状态从噪声预测并与帧联合去噪。数据亮点emulator 读 5 维状态Gemini 平衡 win/lose/macro success/fail/normal状态关键样本占 40%NPC 策略文本三类。相比其他方法的创新之处把“内部状态”从评测旁路拉进生成主环相对 shared 骨干与“状态也走 FM”MoT回归在 mechanics fidelity 上明显更强文中相对无状态最强基线约 18.6%。基于前人的哪些方法Wan2.2作为视觉生成骨干与 VAE/text encoder提供画面分支。World Action ModelWAM/ MoT 联合建模思路借鉴「多模态分专家 交叉交互」来同时建模另一路信号此处把 action 换成 game state。ReactiveGWM沿用其 SF 数据采集与 NPC 策略标注流水线扩展为同步状态标注。实验exp1:设置在同一 state-aware 数据上StatePlay vs 微调后的无状态 game WM主看 mechanics fidelity、状态对齐、画质与控制数据自建 SF310k 训练 / 100 测试 clips结论state alignment≈0.947mechanics 约 82%/78%Gemini/GPT相对最强无状态模型约 18.6%画质与控制不牺牲提到的同类工作Genie(2024): 交互游戏环境ReactiveGWM(2026): 同域最强无状态基线LingBot-World 2.0(2026): 通用交互零样本 mechanics 仍弱From Pixels to States(2026): 有状态标注未闭环证明如何抬 mechanicsWildWorld(2026): 带 action/state 的动态世界数据相关性最高的工作ReactiveGWM(2026)Genie(2024)From Pixels to States(2026)
返回列表