
这项由Alaya Lab与上海创新研究院联合完成的研究于2026年7月30日以预印本形式发布论文编号为arXiv:2607.28362。研究提出了一种名为ShadowDancer的视频世界模型控制方法感兴趣的读者可通过该编号在arXiv平台查阅完整论文。一、当游戏世界遇上动作控制的难题玩过沙盒游戏的人大概都有过这样的体验你想让游戏里的角色做一个特定的翻滚动作但游戏偏偏只给你攻击、防御、跳跃这几个固定按键根本没法精细控制。AI研究领域里有一类叫做交互式视频世界模型的技术目标是让AI实时生成一个可以自由探索的虚拟世界类似于让AI扮演一个超级游戏引擎用户说做什么就生成对应的画面。这项技术近年来发展迅猛Oasis、Genie等系统已经能生成相当流畅的虚拟世界。然而一个棘手的问题始终悬而未决怎么告诉AI你到底想让世界里的东西怎么动现有的方法要么太粗糙要么太局限。给AI发一个攻击的键盘指令AI只知道有个攻击动作发生了但具体怎么挥剑、挥多大弧度、节奏快还是慢全凭AI自己发挥根本无法精确指定。而如果想精确到每一帧比如用3D骨骼姿态来控制人物的每个关节角度这套方案虽然精准却只适用于人物动作这一种类型换成机器人手臂、赛车、魔法技能又要重新设计一套截然不同的控制系统。ShadowDancer团队给这个问题起了一个很形象的名字表示瓶颈。问题不在于AI不够聪明、画不出好看的画面——现有的视频扩散模型已经能生成极其逼真的复杂运动了——真正的症结在于我们缺少一种通用的语言能够跨越人物跑步、机械臂抓取、赛车过弯等完全不同的动作类型统一、精准地告诉AI接下来要发生什么动作。一个自然的想法是直接给AI看一段示范视频。正如武术教练教徒弟时会说你看我怎么打视频本身就是最直观、信息最丰富的动作说明书——它逐帧描述了动作的每一个细节。AI研究领域里已经有一类叫做潜在动作模型的方法尝试这条路做法是让AI从参考视频里提取一段压缩的动作信号然后用这个信号驱动新画面的生成。但这里藏着一个几乎被所有人忽视的根本性陷阱而ShadowDancer的整个故事正是从发现这个陷阱、然后彻底绕过它开始的。二、潜伏在示范视频里的影子幽灵考虑这样一个场景你想教AI重现一个人在草地上挥拳的动作。你给它看一段视频视频里是一个身穿红色T恤的男人在阳光明媚的草坪上挥拳。AI从这段视频里提取出动作信号然后在另一个场景里——比如雨天的城市街道——用这个信号驱动新人物做出动作。问题来了AI从那段视频里提取的究竟是挥拳这个动作还是一个穿红T恤的男人在草地上挥拳如果是后者那当场景换成雨天街道、人物换成穿蓝外套的女性时这个动作信号就会失灵因为它实际上混入了太多跟动作本质无关的信息——衣服颜色、草地纹理、阳光方向。传统的潜在动作模型存在一个被研究者称为自重建的根本性缺陷。这类模型在训练时的任务是从视频A的第t帧到第t1帧提取一个动作信号然后用这个信号预测第t1帧的内容。但预测的目标就是视频A本身这意味着AI有一条取巧的捷径把场景外观、角色外貌等所有信息都塞进动作信号里这样重建自然万无一失。AI没有任何理由去区分哪些信息属于动作本质哪些属于外观装饰反正混在一起重建效果更好。研究团队将这个现象称为纠缠——动作信号与外观信息缠绕在了一起就像一团乱麻。之前的研究尝试用信息瓶颈强行压缩信号的容量或正则化惩罚信号里包含外观信息的倾向来解开这团麻但效果有限。因为这些方法本质上都是在给AI施加额外的约束和惩罚而AI面对的训练数据始终是同一个场景下的同一段视频——动作和外观永远绑定在一起AI从来没有机会看到同一个动作在两种不同外观下的样子。这就是ShadowDancer的洞察所在与其用惩罚的方式让AI猜测哪部分是动作不如直接构造一种训练数据让动作和外观在数据层面就被分离开来。三、影子是什么同一个舞蹈的两种打光ShadowDancer团队发明了一个极其精妙的概念叫做影子对Shadow Pair。回到那个挥拳的例子。现在团队不是给AI看一段视频而是给它看两段视频。这两段视频里的动作完全相同、每一帧的时间完全同步——同样的挥拳节奏、同样的弧度、同样的时机。但两段视频里的所有外观因素都是独立重新选取的第一段视频里是穿红T恤的男人在草地上第二段视频里是穿蓝外套的女人在仓库里。动作相同外表迥异。这就是影子的含义一段视频是某个动作轨迹在某种外观下的投影而它的影子是同一个动作轨迹在另一种外观下的投影。就好像同一支舞蹈在聚光灯下表演和在自然光下表演两段录像里的光影、服装、背景天差地别但舞步本身分毫不差。用更精确的语言来说团队将视频建模为一个渲染过程一段视频等于动作轨迹加上外观因素经过渲染得到的结果。动作轨迹包括物体怎么运动、角色如何移动外观因素包括角色长什么样、场景是什么环境、光照从哪个方向来。一个影子对就是拿同一个动作轨迹、用两套独立随机选取的外观因素分别渲染得到两段视频。这个定义有一个非常优雅的性质从两段视频中真正共同存在的只有动作轨迹。外观因素是独立随机选取的所以它们之间没有任何系统性的关联。如果AI想从第一段视频里提取一个信号用来预测第二段视频里会发生什么这个信号里就必须包含动作轨迹而且不需要包含外观信息——因为外观信息对预测第二段视频毫无帮助第二段视频的外观是全新随机选取的跟第一段毫无关联。这个训练方式被称为跨影子预测给AI看第一段视频来源影子让它提取动作信号然后用这个信号加上第二段视频目标影子的第一帧外观预测第二段视频接下来的每一帧。由于目标影子的外观已经通过第一帧告诉了AIAI唯一需要从来源影子里提取的就是动作本身。这种方式的巧妙之处在于它不是在惩罚AI提取外观信息而是从根本上让外观信息变得没有用处。AI不是被禁止混入外观而是自然地发现混入外观毫无意义因为目标场景的外观跟来源场景的外观根本没有关系。动作信号里的纠缠问题就这样被数据构造的方式从源头化解了。四、影子库如何大规模制造影子对有了影子对的概念下一个问题是怎么在实际中大量制造这样的数据关键在于复现动作、重新选取外观这个操作。在现实世界里这几乎是不可能的——你不可能让同一个人以完全相同的方式挥拳两次同时还要彻底换一身衣服、换一个场景。但在数字世界里这完全可以做到。团队构建了一个叫做影子库Shadow Library的数据集通过多种数字渲染环境来批量生成影子对。对于人体动作他们使用了3D动画软件Blender将SMPL-X格式的人体动作数据一种描述人体骨骼运动的数字格式分别套用到不同的数字角色上放置在不同的虚拟场景里配合不同的灯光和摄像机角度渲染出多段具有完全相同骨骼运动但外观各异的视频。对于机器人手臂他们使用了ManiSkill机器人仿真平台让同一套手臂运动轨迹在不同的机器人外形、不同的桌面环境、不同的物体摆放下被重复渲染。对于游戏场景他们在GTA风格的城市场景和赛博朋克风格的夜城、以及虚幻引擎搭建的第三人称游戏场景中让同一条运动轨迹在不同地图、不同天气、不同时间段下被重复捕捉。此外相机运动轨迹也是一个单独的动作家族他们通过让同一条相机运动路径穿越不同的静态场景来生成影子对。整个影子库最终包含了约数千到数万个序列、合计数百万帧的影子对数据覆盖了人体运动、机械臂操作、第一人称游戏战斗、第三人称游戏技能释放和相机轨迹控制五大动作家族。团队还有一个聪明的处理方式来引入真实世界视频。真实视频无法制造影子对但真实视频里有大量珍贵的真实场景外观信息对提升生成画面的视觉质量很有帮助。解决方案是将真实视频作为退化的自身影子对引入训练——即把同一段视频既当来源又当目标。这样真实视频为模型提供了视觉多样性和真实感而真正的动作-外观分离学习信号则来自合成的影子对。团队引入了MiraData互联网视频数据集以及OpenX机器人操作数据集中的多个子集作为真实视频来源。五、跨影子预测的数学机制与理论保证团队不满足于直觉性的解释他们还从理论上严格证明了跨影子预测方法的正确性。整个训练框架使用了一种叫做变分自编码器的结构但做了关键性的修改。具体来说模型有一个编码器和一个解码器。编码器负责从来源影子视频的相邻两帧中提取一个32维的压缩动作向量即潜在动作。解码器则接收目标影子的当前帧外观加上编码器提取的动作向量预测目标影子的下一帧。训练的损失函数来自标准的β-VAE框架预测误差越小越好同时动作向量的分布应该尽可能接近一个简单的高斯分布这个约束起到信息瓶颈的作用防止动作向量无限膨胀。理论部分的核心定理证明了在三个合理的假设条件下跨影子预测的最优解就是动作轨迹本身在一个可逆的重新参数化意义下。这三个假设分别是来源影子和目标影子在给定动作的条件下相互独立即重新选取外观的操作确实把两个渲染过程分开了动作轨迹可以从来源视频中被观察到不同的动作轨迹会在目标场景里产生不同的效果即动作之间能被区分开来。换句话说这个理论保证了只要影子对构造得正确跨影子预测不仅在直觉上应该学到动作在数学上也必然会学到动作别无他法。这是一个比正则化惩罚外观强得多的保证——后者只是在努力减少外观的影响而跨影子预测是从根本上让外观信息在预测任务中变得无关紧要。团队还进一步证明了在函数可以连续、紧致支撑等标准数学条件下神经网络可以以任意精度实现这个理论最优解。这意味着理论保证不只存在于抽象数学空间里在实际的神经网络训练中同样适用。六、从动作信号到可交互的世界模型学会了提取纯净的动作信号下一步是让这个信号真正驱动一个可以实时交互的视频世界。团队以SkyReels-V2-1.3B这个预训练视频扩散模型作为骨干网络。视频扩散模型可以理解为一个图像合成引擎它通过逐步去除噪声来生成高质量的视频帧。团队在这个骨干模型上做了两项重要改造。第一项改造是动作条件注入。提取出来的动作向量通过两条渠道影响视频的生成一条是通过自适应层归一化调制将动作向量融入每个生成步骤的时间步嵌入提供全局性的低频控制相当于设置整体运动的大方向另一条是通过专用的交叉注意力机制让生成过程的每一帧都能精细地查询对应时刻的动作信号相当于逐帧调整细节。与此同时来源影子视频本身也被编码成运动资产Motion Assets通过通道拼接和额外的交叉注意力注入模型为生成过程提供高频运动细节——因为32维的动作向量太小无法携带四肢的精确姿态、接触时机等细节这些细节通过来源视频的完整编码来补充。第二项改造是块因果转换这是让模型支持实时交互的关键。原始的视频扩散模型是双向的——它在生成一段视频时需要同时考虑前后所有帧就像在修改整张画布。这对于交互式应用来说是不可接受的因为用户发出动作指令后模型无法等所有帧都确定了才开始生成。团队借鉴了近期关于视频扩散模型因果转换的研究将模型改造成块因果生成器视频帧被分成一个个小块块内可以双向建模但块与块之间只能前向参考——即第二块只能看第一块不能偷看第三块。在推断时模型逐块生成维护一个键值缓存Key-Value Cache来保存历史信息从而实现流式输出动作指令进来就能持续生成视频流。七、动作资产把示范视频变成可复用的技能卡ShadowDancer最有实用价值的概念之一是动作资产Action Asset。当一个用户想让世界模型重现某个特定动作时他们只需要录制或找到一段展示该动作的参考视频。通过已经训练好的冻结的编码器这段视频被一次性处理成一串动作向量序列打包存储起来。这就是一个动作资产。之后无论在什么新场景、新环境里只要把这个动作资产插入到世界模型的控制流中模型就会在新场景里重现这个动作——完全不需要重新训练不需要任何动作标注不需要知道视频里是什么类型的运动。更进一步不同的动作资产可以自由拼接。先跑步、再跳跃、再挥剑只需要把三个动作资产按顺序排列世界模型就会按这个顺序在新场景里依次执行。为了让模型在训练时就适应这种拼接方式而不只见过连续的参考视频团队在训练过程中以一定概率将连续的来源视频替换为从预建资产库中随机抽取并拼接的片段。这样在实际使用时通过离散指令查找并拼接动作资产的操作模式完全匹配模型在训练中见过的输入分布。还有一个精妙的细节动作向量序列是逐帧的而视频扩散模型的3D-VAE视频压缩编码器在时间维度上有4倍的压缩率即每4帧视频对应1个潜在帧。为了保持对齐团队将相邻4帧的动作向量取平均后注入对应的潜在帧确保动作信号的时序精度不因压缩而损失。八、一个编码器三个读取头分离相机与场景动作现实中的视频是多种运动的叠加相机在移动人物也在移动物体也在运动。如果只提取一个混合的动作信号有时候用户只想控制相机比如环绕镜头有时候只想控制人物不关心镜头怎么动有时候需要同时控制两者。ShadowDancer通过一个叫做因子选择性读取的机制来解决这个问题而且不需要训练多个编码器一个编码器就能搞定所有情况。具体做法是在编码器的每一帧输入序列前面加上三个特殊的提示词令牌分别对应相机动作头、场景动作头和完整动作头每个头拥有独立的变分读取模块。影子库里的不同数据源会激活不同的头相机运动影子对场景和人物外观被重新选取只有相机轨迹保持不变会监督相机动作头场景动作影子对相机被重新选取只有人物/物体运动保持不变会监督场景动作头两者都保持不变的影子对会监督完整动作头。在推断时同一段参考视频可以被读取三次得到三个独立的动作信号一个纯相机动作、一个纯场景动作、一个两者的结合。用户可以自由选择使用哪个信号甚至可以把一段视频的相机动作和另一段视频的人物动作混合在一起创造出全新的控制组合。九、实验结果数字说话视觉比较团队设计了两类核心实验来验证ShadowDancer的效果并与现有最先进的方法进行了系统性对比。第一类实验叫做动作跨场景迁移测试的核心问题是从一个场景里学到的动作信号能否精准地在另一个场景里重现出来具体做法是从影子库的测试集里取出影子对用第一段视频来源影子提取动作信号然后从第二段视频目标影子的第一帧出发用这个动作信号驱动生成最后把生成结果与目标影子的真实后续帧逐帧比较。对比的基准方法是Olaf-World这是当时最先进的自重建潜在动作模型使用了特征对齐正则化来尝试减少外观纠缠。两个模型使用相同的训练数据和相同的视频扩散骨干网络确保比较的公平性。结果相当显著。在人体运动上ShadowDancer的PSNR峰值信噪比越高越好从18.2提升到22.4LPIPS感知图像相似度越低越好从0.288降到0.184。在第一人称战斗场景上PSNR从13.0提升到17.0LPIPS从0.532降到0.354。在第三人称动作游戏上PSNR从12.6提升到17.4LPIPS从0.506降到0.309。在机器人手臂操作上PSNR从14.0提升到22.6LPIPS从0.478降到0.116——这是最大的提升幅度接近于将误差减半。相机控制则通过轨迹误差来评估绝对轨迹误差ATE从0.072降到0.005相对位姿误差RPE从0.021降到0.003精度提升了一个数量级。从视觉上看Olaf-World生成的视频常常出现明显的扭曲变形——人物的身体会莫名拉伸或扭转相机会出现意外的漂移因为混入了外观信息的动作信号在新场景里水土不服产生了错误的运动指令。而ShadowDancer生成的视频则能忠实地在新场景里重现参考动作的节奏、幅度和风格角色的身体形态保持自然相机运动也流畅准确。为了确认提升来自动作表示本身而非生成质量团队还在不进行任何生成的情况下直接对潜在动作向量做了探针实验。他们训练了线性分类器尝试从动作向量里读取角色身份信息动作内容的指标越高越好和场景信息外观泄漏的指标越低越好。结果表明跨影子训练的动作向量对角色身份的解码准确率达到随机猜测的11倍同时场景信息的泄漏量显著低于自重建方法。自重建方法的动作向量在角色身份解码上几乎只有随机猜测的水平却泄漏了更多场景外观信息。这直接证明了动作表示质量本身的差异而非仅仅是生成质量的差异。第二类实验叫做长时间动作连续滚动测试的是把多个动作资产拼接起来让世界模型做连续长时间的动作执行时效果能否保持稳定。这种场景没有逐帧对齐的真实值可以比较因此采用了盲评的方式让一个视觉语言模型Fable 5对两段视频进行两两强制选择比较分别在动作是否确实被执行、动作的具体细节是否被保持和长时间执行中是否出现漂移或退化三个维度上打分。这次的对比对象扩展到了更多系统Olaf-World潜在动作方法、Yume-1.5文本键盘指令驱动的交互世界模型和LingBot-World 2.0相机轨迹文本事件触发驱动的交互世界模型。每个系统通过自己原生的接口接收相同的指令序列。结果显示ShadowDancer对Olaf-World的偏好率在三个维度上分别为94%、95%和94%对Yume-1.5分别为88%、86%和91%对LingBot-World 2.0分别为78%、83%和64%。其中LingBot-World 2.0在长时间一致性维度上仅有64%的偏好率说明ShadowDancer在这个维度上的优势对这个特定对手而言相对较小但在其他维度仍有明显优势。十、消融实验每个组件各贡献了多少为了精确量化各个设计决策的贡献团队做了细致的消融实验像外科手术一样逐一测试每个组件的必要性。最基础的配置是纯粹的自重建潜在动作模型参照Olaf-World的做法在测试数据上的PSNR为12.44LPIPS为0.555。加上影子对训练但不加来源视频资产后PSNR提升到14.75LPIPS降到0.448——说明影子对本身确实带来了实质性的改善。仅用来源视频资产不用动作向量的配置得到了PSNR 15.07和LPIPS 0.420说明来源视频本身就是一个强大的动作载体因为它直接包含了动作的视觉信息。最关键的一组对比是用自重建方式训练的动作向量加上来源视频资产与用影子对训练的动作向量加上来源视频资产这两种配置的差异。前者PSNR为14.92后者即完整的ShadowDancerPSNR为16.35。这意味着当来源视频资产已经存在时加入一个自重建训练的动作向量几乎没有额外收益PSNR从15.07到14.92基本持平甚至略有下降但加入一个影子对训练的动作向量PSNR还能再提升1.4分。换句话说一个用自重建方式训练的动作向量在有了来源视频资产之后几乎没有增量价值因为它携带的信号已经被来源视频所包含甚至混淆了而一个经过跨影子训练的纯净动作向量携带的是来源视频里高度压缩的动作本质与来源视频的视觉细节形成互补一起提升了最终效果。团队还做了另一个探针实验来测试动作向量与来源资产各自的贡献分别把对方替换成来自另一个场景的版本或者把动作向量在时间上打乱顺序或者把来源视频降低到四分之一分辨率。结果表明在五个动作家族中的四个里替换或打乱动作向量都会导致PSNR显著下降2到3分左右而降低来源视频分辨率几乎不影响PSNR变化在0.4分以内。这清楚地表明指令性的动作信息主要存在于动作向量中而来源视频主要贡献外观和高频细节。十一、教AI一个它从未见过的动作团队还设计了一个充满挑战性的测试在训练完成之后通过游戏Mod引入一个全新的角色和一种全新的武器双手挥舞的大剑不同于训练时使用的单手射击武器让AI重现这个角色做出走路、转身和大剑挥砍动作。这些动作资产录制自一张地图然后在另一张地图AI从未见过的地图上用于生成。结果显示这个从未见过的大剑挥砍动作被成功重现在了新地图上——步法的节奏和大剑的挥动轨迹都得到了保留尽管模型在训练时从未见过这种角色或这种武器。这验证了ShadowDancer的编码器确实在学习动作的本质轨迹而非记忆特定的动作类别标签。新动作的加入只需要一次前向传播提取动作资产无需任何额外训练动作库就此扩展。这被团队认为是整个范式最重要的扩展潜力随着用户演示新动作动作库可以无限增长而不受模型训练数据的限制。归根结底ShadowDancer做的事情就是让AI第一次真正地从看到理解动作本质——不是记住一个动作跟某个特定角色、特定场景的绑定而是把动作从一切外观装饰中剥离出来得到一个能在任何新场景里重现的纯净动作蓝图。研究团队也坦诚地指出了两个现实局限其一动作资产必须提前准备好对于从未被演示过的动作系统无法凭空生成其二影子对目前只能在游戏引擎和仿真器里方便地制造真实世界的视频很难重现完全相同的动作并替换外观。不过团队也指出了解决路径未来可以用视频生成模型来批量生成外观各异但动作一致的合成影子对或者用视频编辑模型将真实视频的外观替换掉同时保留运动从而把这个框架从数字世界延伸到真实世界。考虑一下这意味着什么未来的游戏引擎或影视制作工具可能只需要录制一段示范动作就能让任意角色、任意场景中精准重现这个动作无需动作捕捉设备无需手动标注无需为每种新动作重新训练模型。这对交互式娱乐和机器人仿真训练都有值得期待的影响。如果你对完整的技术细节感兴趣可以通过arXiv编号2607.28362查阅原始论文研究团队也在ShadowDancer-1.github.io上提供了演示视频。QAQ1ShadowDancer的影子对和普通的数据增强有什么区别A普通数据增强如随机裁剪、变色是在已有视频上做后处理无法真正替换外观、保留动作——改变颜色不等于换一套场景和角色。影子对是在渲染层面操作的直接用同一套运动数据在两套完全不同的场景和角色外观下重新渲染两段视频的运动轨迹逐帧完全一致而外观是独立随机选取的。这是本质性的区别影子对让动作和外观在数据层面就真正分离而不是靠惩罚项去猜测哪部分是动作。Q2ShadowDancer控制机器人和控制游戏角色用的是同一个模型吗A是的这正是ShadowDancer的核心设计目标之一。整个系统只有一个编码器和一个潜在动作空间不同动作家族人体运动、机械臂、第一人称游戏战斗、第三人称游戏技能、相机控制都通过这同一套接口来控制。影子库里不同来源的影子对共同训练同一个编码器让它学会了在同一个32维的动作向量空间里表示各种各样的动作轨迹。世界模型同样只训练一次通过动作向量流和来源资产来接受来自任何动作家族的控制信号。Q3ShadowDancer生成的视频质量跟真实游戏画面比如何A目前ShadowDancer的生成质量在与其他AI视频世界模型的对比中处于领先位置但与商业游戏引擎渲染的真实游戏画面相比仍有差距。研究评估显示ShadowDancer在动作精准度上相对基准方法有显著提升且弗雷歇视频距离FVD衡量视频真实感的指标约为竞争对手的一半说明生成画面的视觉质量也有改善。但论文本身也明确指出生成质量评估不在本研究的核心关注范围内重点在于动作控制的准确性和跨场景迁移能力。