尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

从AI视频到AI世界:Decart AI实时世界模型技术拆解

从AI视频到AI世界:Decart AI实时世界模型技术拆解 从 2024 年 Oasis 引爆社交媒体到 2025 年传出估值突破十亿美元的消息Decart AI 这家来自以色列的初创公司可以说是在“AI 视频生成”最热闹的当口忽然把赛道往前推了一大步——它不再满足于让 AI 生成一段几秒钟的视频而是让 AI 实时生成一个可以操作、可以探索、可以不断演化的“世界”。这种从“AI 视频”到“AI 世界”的跃迁不光是产品形态的变化更牵扯到模型架构、推理成本、工程体系甚至商业模式的重构。本文就从技术视角拆解 Decart AI 的核心逻辑分析它为什么会被硅谷顶级资本连续押注同时给关注 AI 工程化落地的开发者整理出一条可以借鉴的技术路线。1. Decart AI 是什么从“生成画面”到“生成世界”1.1 一句话理解 DecartDecart AI 是一家专注于实时生成式 AI 的以色列初创公司成立于 2023 年创始人是 Moshe Shmayo 和 Dean Leitersdorf。它最出圈的产品是 2024 年底发布的 Oasis——一个完全由神经网络实时生成画面的可玩“游戏世界”。玩家用键盘控制角色移动画面不是来自传统游戏引擎的预渲染而是由扩散模型根据玩家的每一次输入实时推算出来的。这意味着什么呢传统的游戏画面是美术资产加引擎渲染的结果传统的 AI 视频生成是你输入一段提示词模型离线生成十几秒的视频生成过程中你无法干预。而 Oasis 做到的是模型成为一个实时交互的世界模拟器你按一下方向键画面里的世界就往前推进一帧。它输出的不是一段固定的视频而是一个持续演化的模拟环境。1.2 它解决的并不是“做游戏”这么简单很多人第一次看到 Oasis 的 demo会觉得它像“一个像素风 Minecraft”。但如果只把它理解为“AI 做游戏”就低估了这件事的意义。Oasis 本质上是一个基于扩散模型的世界模型World Model它的底层命题是如果模型不仅学会了“下一帧长什么样”还学会了“当前动作导致下一帧变成什么样”那它就已经开始理解“世界如何运作”了。传统 AI 视频模型学的是“给定历史帧预测未来帧”的视觉延续性而交互式世界模拟器学的是“给定历史帧 用户动作预测未来帧”的因果建模。这个多出来的“动作条件”把模型从被动的视频生成器变成了主动的环境模拟器。这也是 Decart 被资本看重的最核心原因——它抢先验证了一条从“生成内容”到“生成环境”的路径。1.3 常见概念辨析这里需要把几个容易混淆的概念切开AI 视频生成输入文本 / 图片 / 视频输出一段新的视频。典型代表是 Sora、Runway、可灵等。生成过程是非交互的生成结果是一次性的。AI Agent调用大模型做任务规划、工具调用和决策执行核心在“任务”和“工具”不一定是视觉生成。AI 世界模型用神经网络模拟环境在给定动作下的状态变化核心在“状态转移”和“交互反馈”。它可以用于游戏也可以用于自动驾驶仿真、机器人训练等。AI 世界AI World一个可以被用户实时探索、编辑、演化的大规模模拟环境可以看作多个世界模型 多模态生成 实时渲染 Agent 系统的综合体。Decart 现阶段最像“AI 世界”的雏形但它的技术栈里同时包含了模型推理、实时渲染、分布式训练、用户体验设计等多个领域不是单纯的“换个模型架构”就能做到的。2. 技术核心实时扩散模型与世界模型原理2.1 Oasis 为什么让人“震撼”Oasis 之所以让开发者都觉得惊艳不只是画面效果而是因为它在“实时”和“生成质量”之间找到了一种可跑的平衡点。玩家操作后模型要在一帧以内完成推理才不会有明显卡顿。扩散模型本身是出了名的计算密集传统跑一张 512x512 的图可能需要几十步去噪哪怕用高性能 GPU 也要好几秒。Oasis 能做到实时说明它在模型架构、采样步数、推理框架上都做了大量工程压缩。2.2 扩散模型做世界模拟的基本流程扩散模型的核心思想是训练时不断向清晰图像加入噪声让模型学会“去噪”。推理时从纯噪声出发逐步还原成图像。如果用扩散模型做世界模拟输入不能只是随机噪声而要包含上一帧画面和当前动作。一个简化版的思路如下# 伪代码交互式扩散世界模型的核心思路 # 注意仅为理解原理而写的简化示例不是 Oasis 的真实实现 import torch import torch.nn as nn class SimpleWorldModel(nn.Module): def __init__(self, unet): super().__init__() self.unet unet # 一个去噪网络 def forward(self, prev_frame, action_embedding, noise_level): # 把上一帧图像编码 动作编码拼接成条件 cond torch.cat([prev_frame, action_embedding], dim1) # 预测当前帧的噪声 return self.unet(cond, noise_level) # 推理时从噪声开始用少量步数去噪生成当前帧 def generate_frame(model, prev_frame, action, steps4): x torch.randn_like(prev_frame) # 初始噪声 for t in range(steps): noise_pred model(prev_frame, action, t) x x - noise_pred * 0.1 # 简化的去噪步进 return x真实工程里不会这么简单但这个流程已经能说明关键点模型必须学会同时理解“当前画面”和“用户动作”才能生成“下一帧画面”。动作可以编码成方向向量、离散 token甚至是更复杂的语义指令。2.3 为什么不能直接套用视频生成模型视频生成模型通常把输入视频压缩成 latent然后预测新 latent最后在空间和时间上解码。它适合离线生成但不适合实时交互原因有三个延迟瓶颈视频生成往往一次生成多帧帧越多延迟越高交互体验越差。而世界模型必须做到“先响应一帧再持续生成”。条件不同视频生成的条件通常是文本或首帧世界模型的条件是持续变化的用户输入条件序列长度不定需要不断累积上下文。长期一致性视频生成只要保证一小段内视觉连贯世界模型需要维持长期的场景一致性比如你绕了一圈回来建筑应该还在原地。所以 Oasis 背后的工程问题并不是“把生成速度加快一点”而是从训练数据到模型结构、从推理策略到缓存机制都要重新设计。2.4 关键工程手段减少采样步数、模型压缩、蒸馏无论是 OpenAI Sora 还是 Decart Oasis实际落地的实时生成都离不开“把长采样流程压缩成短采样流程”。常见的工程手段包括减少扩散步数训练时让模型学会用 2~4 步甚至 1 步完成去噪。模型蒸馏用大模型教小模型让小模型在较少步数内逼近大模型效果。低比特量化把 FP16 权重压缩到 INT8 或 INT4降低显存占用和带宽压力。Kernel 融合把多次小算子融合成一次大 Kernel 调用减少 GPU 启动开销。大小模型协同用轻量模型快速生成当前帧同时后台用大模型优化长期一致性。这些优化思路在 CV 领域已经很成熟但放到“实时交互世界模拟”这种极致延迟敏感的场景就需要更深入的协同优化。这也是为什么 Decart 选择和 Etched 合作推出 Transformer 专用推理芯片 Sohu 的原因——当模型推理本身成为产品核心通用 GPU 的算力利用率往往不够专用硬件有更大的优化空间。3. 工程挑战AI 视频到 AI 世界的技术跨越3.1 算力消耗的指数级上升AI 视频生成一次任务只需要跑一次推理比如生成 5 秒视频可能只消耗 50 次扩散迭代。而一个“AI 世界”只要还在运行每一帧都在推理。假设每秒生成 20 帧持续运行 10 分钟就是 12000 次推理。这不是“生成一个内容”而是“持续生产内容”算力消耗直接拉高好几个数量级。这也是为什么资本愿意给高估值AI 世界如果真的成为下一代交互平台它的算力需求会远超 AI 视频和 AI Agent。那些拥有推理优化能力、芯片合作、云基础设施的公司会在成本上形成护城河。3.2 实时系统的延迟预算在 AI 世界产品里端到端延迟预算通常被压缩到 50ms 以内否则用户会感觉到明显的“不跟手”。这 50ms 里还要拆成网络传输、输入处理、模型推理、画面编码、前端显示。留给模型推理的时间可能只有 20ms 左右。要做实时扩散模型推理就需要把模型切成流水线并行让不同帧在不同 GPU 上并行处理。用连续批处理continuous batching填满 GPU 算力。用帧复用策略在画面变化不大时复用上一帧的部分特征。在保证用户手感的前提下动态降低生成分辨率或帧率。下面是一个简化版的推理服务配置示例体现这种系统分层思路# 示例AI 世界推理服务架构非 Decart 官方配置 inference: model: oasis-like-diffusion precision: fp16 sampling_steps: 4 kv_cache: true pipeline: - name: input_handler timeout_ms: 5 - name: frame_generator timeout_ms: 20 backend: tensorrt device_count: 8 - name: encoder timeout_ms: 10 format: h264 batching: strategy: continuous max_batch_size: 32 dynamic_batching: true3.3 上下文管理与场景一致性传统扩散模型没有“记忆”每帧都是独立生成这会导致世界漂移world drift你走过一个路口再回头路口可能变了样。要解决这个问题需要引入短期记忆和长期记忆机制。短期记忆保留最近几十帧的 latent 特征长期记忆保存场景关键对象的语义描述。模型在生成当前帧时会同时参考当前输入、短期 latent 缓存和长期语义记忆。这种问题的本质是“状态管理”和大模型里的 context window 管理、RAG 系统里的分片索引非常像。区别在于世界模型的状态不仅是文本还包括图像特征、动作序列、物理规则。这意味着开发者不能只套用 LLM 工程的成熟方案而需要设计一套多模态状态管理系统。3.4 数据飞轮的构建难度训练一个世界模型需要“动作-画面变化”成对的数据。最自然的数据来源是游戏录屏加按键记录但这涉及版权问题。Decart 的公开 demo 里有不少类似 Minecraft 风格的场景但要真正构建泛化的世界模型还需要更丰富的环境交互数据。这也是 AI 世界后续发展的一个重要瓶颈。4. 资本视角为什么硅谷顶级资本会押注 Decart4.1 资本看中的是“下一代平台入口”回顾互联网和移动互联网的历史真正的平台级机会来自“新的交互模式”从命令行到图形界面从鼠标到触屏从 App 到云端。AI 世界如果成熟它会让用户从“看 AI 生成的内容”变成“生活在 AI 生成的世界里”。这种高黏性、强交互、持续在线的新形态非常符合资本对“超级应用”的想象。Decart 选择从游戏切入是因为游戏天然具备高交互密度、强实时性、用户接受度高是最容易验证世界模型能力的场景。4.2 技术团队和稀缺能力Decart 创始团队有以色列国防科技背景这类团队在系统工程、实时系统、高性能计算方面往往有极强的执行力。更重要的是他们证明了“实时交互扩散模型”不仅在论文里成立而且能在消费级平台上跑通。顶级资本投的从来不只是当下的产品更是“这个团队能不能在下一个技术拐点到来时继续保持领先”。4.3 与芯片厂商的深度绑定Decart 与 Etched 合作这件事非常关键。Etched 做的是 Transformer 专用芯片 Sohu目标是让模型推理从“通用 GPU 勉强能跑”变成“专用硬件高效能跑”。如果 AI 世界真的成为主流应用形态像 Decart 这样掌握实时推理框架、同时与专用芯片深度绑定的公司会获得巨大的成本优势。这也解释了为什么 NVIDIA 等硬件巨头会出现在它的投资方名单里——AI 世界一旦爆发会带动巨额算力采购硬件厂商必须提前押注最有希望把“世界模拟”做成规模产品的团队。4.4 商业模式潜力AI 世界的商业模式可以不做成“付费游戏”而是做成“可交互的生成空间”用户付费定制世界、创作者在 AI 世界里搭建内容、品牌在里面做虚拟展览和营销活动甚至可以把 AI 世界当作 AI Agent 的训练场。这些想象空间比单纯的 AI 视频订阅制大得多。5. 给开发者的技术路线参考如何从 AI 视频走向 AI 世界5.1 先跑通一个最小可交互扩散模型如果你也想追踪这个方向不建议直接挑战“AI 世界”这种大工程而是可以从最小可交互场景开始生成一个 64x64 的小画面用键盘输入控制一个小方块移动模型根据方块位置生成下一帧画面。下面是 PyTorch 风格的示例思路帮助你理解数据组织和训练入口。# 示例训练一个交互式世界模型的简化流程 # 文件路径train_simple_world.py # 注意这是理解原理的最小示例不是可训练的完整代码 import torch import torch.nn as nn from torch.utils.data import Dataset, DataLoader class InteractionDataset(Dataset): def __init__(self, frames, actions, num_steps4): self.frames frames # 形状 [N, C, H, W] self.actions actions # 形状 [N, action_dim] self.num_steps num_steps def __len__(self): return len(self.frames) - 1 def __getitem__(self, idx): prev_frame self.frames[idx] next_frame self.frames[idx 1] action self.actions[idx] noise_level torch.randint(0, self.num_steps, (1,)).float() return prev_frame, next_frame, action, noise_level # 模型定义略核心在于把 prev_frame 和 action 拼起来作为条件这个例子的重点不是代码能不能直接跑而是帮助你理解交互式世界模型的数据集是“转移对 (state, action) → next_state”而不是“文本 → 视频”。一旦你理解了这个数据形态就能理解为什么训练这样的模型需要海量的交互数据、需要处理长程一致性以及为什么推理优化如此重要。5.2 掌握推理优化三板斧想要做实时生成你需要掌握三个层面的优化模型层蒸馏、剪枝、量化、低秩分解。推理框架层TensorRT、ONNX Runtime、torch.compile、vLLM 的连续批处理思想。系统层GPU 流水线并行、多卡通信优化、缓存机制、帧率动态调度。下面是一个 PyTorch 推理优化的简化示例# 示例PyTorch 推理优化常见配置 import torch model load_diffusion_model() # 1. 半精度推理减少显存占用 model.half().eval() # 2. torch.compile 加速根据 GPU 选择 mode model torch.compile(model, modereduce-overhead) # 3. 固定输入尺寸方便 TensorRT 等工具做图优化 dummy_input torch.randn(1, 4, 64, 64, devicecuda, dtypetorch.float16) # 4. 用 CUDA Graph 降低 kernel 启动开销 g torch.cuda.CUDAGraph() with torch.cuda.graph(g): output model(dummy_input)在真实项目中还需要结合推理日志和 profiling 工具持续调优不是随便加一个torch.compile就能解决所有问题。建议关注以下几个指标p50 / p99 延迟、GPU 显存占用、首帧延迟、每帧生成时间、采样步数对画质的影响。5.3 从单体推理服务到分布式推理集群AI 世界不可能只靠单卡跑。当并发用户增多你需要把“世界分片”不同用户位于不同区域每个区域由一个推理节点负责世界状态在节点间同步。这个思路很像游戏服务器的分线或 MMORPG 的分区区别在于这里的物理世界是由模型生成的节点之间需要同步的不是玩家坐标和怪物血量而是模型上下文和世界状态。架构上可以参考如下分层用户终端 → 接入网关 → 会话管理 → 世界状态服务 → 推理集群 → 画面编码 → 用户终端其中世界状态服务是一个关键中间层它负责记录每个场景的对象位置、纹理特征、时间状态保证推理节点重启或迁移后世界还能接续。这个中间层可以基于 Redis、etcd 或自研状态同步协议实现核心是“高频状态更新”和“低频持久化”分离。5.4 关注多模态记忆与 Agent 结合AI 世界不只是“画面”未来会有 NPC 角色、有可交互物品、有任务系统。这些能力天然会用到 AI AgentNPC 由 Agent 驱动能理解玩家指令并做规划世界系统把 Agent 的输出转成操作指令再触发画面变化。这意味着 AI 世界开发者的技术栈至少要横跨视觉生成、LLM Agent、状态管理、实时通信四个领域。如果你现在正在做 AI Agent 开发想往 AI 世界方向靠可以先从“给 Agent 增加视觉观察接口”开始让 Agent 每隔一段时间接收“当前世界画面”作为输入输出一个动作 token再把动作 token 传给世界模型。这样一来Agent 就从一个“只会思考的对话系统”变成了“能感知、能行动、能观察行动后果的具身系统”。6. 常见误区与风险提示6.1 把“AI 世界”等同于“AI 游戏”游戏只是 AI 世界最容易落地的场景之一。从长期看AI 世界可以用于机器人仿真训练、自动驾驶虚拟测试、数字孪生、虚拟教育等。如果只把目光放在“生成一个游戏”会忽略它作为“通用模拟器”的价值。6.2 低估实时推理的成本很多人看到 Oasis demo 觉得“好像也不是很卡”但 demo 和规模化的商业产品之间差距巨大。demo 只需要服务很少的并发用户生产环境则要考虑高并发、高可用、成本控制。建议想切入这个方向的技术团队先用推理成本模型算一笔账一小时的 AI 世界体验消耗多少 GPU 时长现有云 GPU 价格能支撑多少并发6.3 忽略场景一致性的工程复杂度模型漂移问题在短 demo 里不明显但用户在线 30 分钟后会非常明显。解决长程一致性不是单纯加模型参数量而是要在系统层做记忆管理和状态同步。这部分工程复杂度往往被低估。6.4 对公开信息保持审慎Decart 的融资、估值、产品细节目前主要来自公开媒体报道和 demo 展示。具体的模型结构、训练数据、推理框架细节并未完整公开。开发者在分析这类公司时要区分“公开验证的技术方向”和“商业宣传”不要直接把 demo 效果等同于成熟产品能力。7. 总结站在“AI 世界”入口处的技术判断从 AI 视频到 AI 世界核心变化不在于“画面更流畅”而在于 AI 从“内容生成工具”变成了“环境模拟平台”。Decart AI 被硅谷顶级资本押注本质上是因为它在模型交互性、实时推理和硬件协同三个方向同时押对了牌。对普通开发者来说这个方向最大的价值是打开了新的技术视野实时扩散模型、世界状态管理、推理优化、多模态记忆、AI Agent 与环境交互这些能力在未来几年会越来越值钱。如果你也对这个方向感兴趣我的建议是不要一开始就追“AI 世界”的大概念。先跑通一个 64x64 的交互像素场景理解“动作条件生成”和“普通视频生成”的差异再用推理优化手段把生成延迟从 500ms 压到 50ms最后再考虑多用户并发、场景持久化和 Agent 接入。这条路看起来漫长但它每一步都在搭建真实的技术壁垒。当“AI 世界”真正成为下一代交互平台时这些积累会直接转化成你的竞争力。
返回列表