尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

京东联合 9 所高校把世界模型做成「能走进去的全模态世界」:EchoWM 把 720p 视频、环境声、对白一次性端到端跑出来

京东联合 9 所高校把世界模型做成「能走进去的全模态世界」:EchoWM 把 720p 视频、环境声、对白一次性端到端跑出来 京东联合 9 所高校把世界模型做成「能走进去的全模态世界」EchoWM 把 720p 视频、环境声、对白一次性端到端跑出来Hugging Face 每日论文2026-08-25 精选8 月 24 日 Hugging Face 每日论文榜排到一个非常具体位置的那篇是京东探索研究院Joy Future Academy, JD联合香港科技大学、北京大学、斯坦福大学、清华大学、复旦、北航、中国科大、港大等 9 所高校联合提交的 EchoWMarxiv:2608.23189。这篇论文给出的不是「视频生成 音频合成」的并联而是一个真正能「走进、绕着、转个视角继续看、听声、听台词」的全模态世界模型。它能同时跑出 720p 分辨率的视频、环境声效、背景音乐和人物对白并且支持第一人称你走动观察和第三人称你绕着角色转视角两种交互模式。这件事的真正难点不是「生成」是「交互下保持同步」世界模型world model在过去一年多的主要进展集中在「让画面更像真实」和「让镜头能按指定轨迹动起来」。但绝大多数工作的生成流程是先按静态轨迹生成视频再后期合成音效与对白。这种「先视觉、后听觉」的串行流程有三个问题声画不同步环境声和对白跟画面对不齐长片段累计偏移尤其明显视角变化下音频空间感丢失镜头一转原本「在人物左侧的脚步声」突然跑到了画面右侧缺少交互延续每段视频都是从「零帧」开始生成无法接续上一段末尾的状态继续演EchoWM 把这些问题一次性端到端解决。它的核心贡献不是某个新模块而是一套把「交互、视觉、听觉」三类信号放在同一个扩散 Transformer 里联合训练的方法。这件事的工程难度非常高因为 720p 视频 音频 对白的多模态生成对显存、token 长度、训练稳定性同时提出挑战。论文里给出了一个工程基线在 25fps、241 帧、1280×736 的输出设置下单卡峰值显存约 46–50GB普通 H100/A100 80GB 卡或 48GB 卡即可跑通——这意味着它不是只能在大型实验室内部署的 demo。三个关键技术设计让「可走进」变成可工程化的能力论文给出的三个相互耦合的设计是 EchoWM 区别于之前所有「可控视频生成」工作的核心设计解决的问题关键做法相机意图接口Camera Intent不同视角下的交互语义不一致把第一人称和第三人称统一到 metric 尺度的 6-DoF 相对轨迹统一架构Architecture异构视频源的度量尺度与控制语义错位dataset 级 metric 校准 相对 UCPE 表征成对几何渐进式训练 自回归后训练联合音视频生成与轨迹控制难以一次性学稳先适配 backbone、再冻结学轨迹、最后联合微调具体来说第一相机意图接口让交互不再绑死「系统是第一人称还是第三人称」。第一人称场景下相对 6-DoF 轨迹直接被解释为「观察者的运动」第三人称场景下同一条轨迹被解释为「镜头围绕角色」的复合运动。模型不接收任何显式的角色轨迹、控制器状态或镜头参数只接收一段 6-DoF 相对轨迹——这是「跨视角共享同一套交互接口」的物理基础。第二统一架构解决了「异构数据源度量尺度不一致」的问题。不同视频源真实街景、游戏画面、风格化场景在度量上差异巨大如果直接归一化会把位移幅度抹平、控制一致性退化。论文的做法是在 dataset 级别做 metric 校准让所有数据共享一个相对 6-DoF 轨迹尺度再用相对 UCPEpairwise camera geometry把相机几何编码进视频自注意力。第三训练过程是渐进式的先把已经预训练好的音视频联合扩散 Transformer 适配到「接收相机轨迹条件」的设置然后冻结 backbone专门学轨迹条件的注入最后联合微调两套参数让整张网络进入稳定状态。自回归后训练再把模型适配到「用自己的历史作为条件」做长程生成——这是「能持续演下去」的工程基础。多轮视角延续世界不会因为镜头离开而「失忆」世界模型要「能走进」最关键的工程指标其实是「走出再回来」是否还能维持同一个世界。EchoWM 给出的解法是「多轮视角延续」multi-turn continuation当用户用相机轨迹走完一段、停几秒、再次输入轨迹时模型能用上一段的尾部窗口作为条件继续生成而不是从头开始。这件事的技术难度在于上一段的尾部不是「干净的第一帧」而是已经包含随机性的视频帧。论文的做法是把「尾窗条件化」tail-window conditioning和「数据集级运动校准」组合起来——前者解决「如何从噪声化的尾帧恢复出有意义的世界状态」后者解决「跨轮次坐标系是否对齐」。论文给出的可视化显示在第一人称室内导航、第三人称人物环绕、长距离走廊行进等多种轨迹下EchoWM 都能维持「同一空间、同一时间、同一物体」的语义连续性。这意味着它不是「会画一段视频」而是「会在脑中维护一个 3D 一致的世界」。「全模态」的关键不是 4 个模态是「4 个模态共享同一个时刻」论文里反复强调EchoWM 不是「视频模型 音频模型 对白模型」的并联而是「4 个模态在同一个时刻被同一个 Transformer 联合生成」。这件事之所以重要是因为如果音频和对白是从画面后期合成出来的那么当画面因为随机性发生小漂移音频无法跟随当镜头快速移动环境声的方向感无法匹配视角当人物说一句话画面里嘴型的细微变化无法跟对白对齐EchoWM 的做法是让视频 token 和音频 token 在共享的音视频 cross-attention 里彼此条件化——音频不直接接受轨迹条件相机轨迹在视频自注意力里注入但它从视频 token 学到的「此时画面里发生了什么」里间接获得语义。这是一条非常克制的设计相机轨迹只走视觉通路音频通路保持纯条件化生成避免「双条件冲突」。论文里给出了一个直观的对比在第三人称「绕角色转视角」场景下EchoWM 输出的环境声会随镜头相对位置的变化保持一致的空间感这在「先视觉、后听觉」的串行流程里几乎是不可能做到的因为后期合成无法访问「镜头运动过程中的画面状态序列」。评测和 SOTA 都在哪些维度比较论文的实验设计覆盖三类评测第一类导航基准。EchoWM 在 WBench Navigation 上排名第一是当前最直接对应「按轨迹生成连续视频」的基准。论文给出的对比里EchoWM 在简单与挑战性轨迹切分上都保持领先。第二类视觉质量。在 SANA-WM-Bench 上EchoWM 在简单与挑战性两个子集上同时达到 top-tier 视觉质量这里的「视觉质量」用 LPIPS、PSNR、SSIM 等像素级指标加上用户研究双轨评估。第三类长程一致性。论文没有给一个单一长程分数而是用多组可视化与人工定性评估展示 EchoWM 在多轮交互、长距离轨迹下的世界连续性。这一类评估方法在当前世界模型研究里仍处于探索期缺乏统一基准但 EchoWM 给出的可视化质量已经明显高于 8 月之前的同类工作。工程侧的数字同样值得关注单卡峰值显存 46–50GB 即可跑 25fps、241 帧、1280×736 的输出模型权重与官方推理代码都已开源jd-opensource/JoyAI-Echo可以在 ComfyUI 里直接调用一个叫 ComfyUI_JoyAI_Echo 的节点包对应做交互式视频生成的工程师可以直接试。为什么 EchoWM 不是「又一个世界模型 demo」过去半年世界模型赛道的「高质量视频生成」工作井喷——Wan 系列、CogVideoX、LingBot-World 系列、GEN3C 等都在做可控视角的视频生成。但绝大多数工作只解决「画面」这一件事对音频、对白、长程一致性的支持非常有限。EchoWM 在 8 月 24 日这个时间点把这三件事同时端到端做完本身就是一个范式级别的信号——「世界模型不再只是视频模型」这件事在 2026 年下半年被正式确立。它意味着做交互式娱乐、做具身智能训练、做内容创作工具的团队从此有了「一个模型同时承担画面声音对白」的工程选择而不是必须把多个模型拼起来并解决对齐问题。更重要的是京东探索研究院把这套能力开源了joyai-echo 仓库、JoyAI-Echo 模型权重在 Hugging Face jdopensource/JoyAI-Echo 可下载。这是 8 月份少数同时做到「论文质量高 工程可复用 开源权重 多家高校背书」的世界模型工作。局限与未验证论文诚实给出了几条边界第一720p 视频 音频 对白的多模态生成对显存和算力的要求仍然高于纯视频生成。46–50GB 峰值显存意味着只有数据中心级 GPU 才能跑通消费级显卡24GB、16GB目前还无法本地运行完整推理。第二EchoWM 的训练数据覆盖「真实室内外、游戏、风格化场景」但对长尾领域医学影像、卫星、显微的支持尚未验证。如果未来要做具身智能训练需要重新评估在这些领域的数据扩展性。第三多轮视角延续的可验证长度仍然有限。论文给出的是「稳定运行」的可视化展示但缺乏一个统一的「最长可延续时间」基准。对于想用它做长时间交互产品的团队这一条需要在工程落地时自己压测。第四自回归后训练虽然让模型能持续生成但「漂移」问题——即随时间推移世界状态逐渐偏离原始场景——在所有世界模型里都尚未被完全解决。EchoWM 通过尾窗条件化缓解了这个问题但没有声明「无限续接」的能力。论文之外可进入的全模态世界意味着什么把这篇论文读完最值得带走的认知是世界模型的研究范式在 2026 年 8 月已经跨过了「视觉质量优先」的阶段进入了「交互一致性 多模态同步 工程可复用」的新阶段。EchoWM 给出了这个新阶段的第一个完整工程样本——一篇 9 校联合、附完整开源代码和模型权重、能在单卡 H100 上跑通、且同时支持第一人称和第三人称交互的全模态世界模型。对于做交互式内容创作的团队来说这是一篇可以直接对照实验的论文对于做具身智能训练的团队来说EchoWM 给出的「6-DoF 相对轨迹 相机意图接口」是一个可借鉴的「跨视角统一控制」工程范式对于做世界模型研究的团队来说EchoWM 给出的渐进式训练 自回归后训练配方是值得在 2026 年下半年持续跟进的基础设施升级路线。
返回列表