尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

无解码器特征预测:自动驾驶世界模型的新思路

无解码器特征预测:自动驾驶世界模型的新思路 世界模型World Model正在成为自动驾驶技术讨论中的高频词一辆车要通过模型在“内部模拟”未来几秒钟的道路环境然后基于这个预测去做规划和控制。这个概念并不新鲜但过去很长一段时间里主流做法都把“预测未来”等同于“生成未来的图像或占用网格”——也就是先让模型重建出一个清晰的未来画面再让决策模块去读这个画面。这个思路看似合理实际落地时却很别扭。DF³Decoder-Free Feature Forecasting提出了一个反直觉的判断如果最终目标是规划与控制那么世界模型不一定需要“解码”成完整画面。与其在未来像素或占用栅格上重建世界不如直接在特征空间预测未来然后把预测特征直接送给任务头使用。这个“Decoder-Free”的关键选择省掉了生成式模型最昂贵、最容易出问题的一条链路也让“预测未来”真正变成了一个面向驾驶任务的中间能力而不是一个独立的视频生成任务。这篇文章会围绕 DF³ 这条技术路线讲清楚三个层面的问题第一它到底解决了自动驾驶世界模型中的哪些痛点第二去掉解码器之后模型结构、训练目标和推理流程发生了什么变化第三你在自己的工程或研究项目里如果想往这个方向尝试应该怎么设计实验、怎么设置指标、又会踩到哪些坑。1. 世界模型在自动驾驶中的角色为什么“预测未来”这么重要自动驾驶系统本质上是一个连续决策问题。车辆在每一帧不仅要理解当前道路上有哪些障碍物还要在几秒之内推断这些障碍物会怎么运动自车应该走哪条轨迹。想要做出安全、平滑的规划系统必须对未来有一个“预演”。这种预演能力就是世界模型要提供的。在传统模块化架构中“预测未来”被拆成了多个独立模块目标检测、目标跟踪、轨迹预测、意图预测。每个模块只处理自己那一部分信息模块之间通过结构化输出传递结果。问题在于这种串行结构很容易累积误差而且每个模块都只建模了局部语义缺少一个统一的环境状态表示。端到端自动驾驶兴起后研究者开始尝试让神经网络直接学习“从传感器输入到规划轨迹”的映射。这种方式绕过了人工设计的中间表示但也带来一个新问题模型缺少对未来的显式建模能力。遇到遮挡、突然横穿、复杂交互时模型只能依赖当前帧的有限信息很难做出有远见的决策。世界模型试图把这两种思路的优点合并起来。它先学习一个关于环境的压缩状态表示再学习这个状态如何随时间演化。拿到当前状态后模型可以在内部推演多条未来路径再选择其中最安全、最合适的一条。这正是人们常说的“让模型像人类一样在脑中模拟后果”。不过世界模型的概念虽好实现方式却天差地别。早期的视频预测模型直接预测未来像素帧后来出现占用栅格预测、BEV鸟瞰视角预测、扩散模型生成等多种路线。它们有一个共同特征都包含解码器把中间特征还原成某种“人类可读”或“规则模块可读”的输出。DF³ 要打破的正是这个“必须解码”的惯性思维。2. 从生成式世界模型到 Decoder-Free Feature Forecasting2.1 生成式世界模型的工作方式先看主流生成式世界模型的典型流程。系统输入连续多帧图像或点云编码器把当前观测压缩到一个潜在特征空间然后一个时序预测器学习从历史特征预测未来特征最后解码器把预测特征还原成未来帧。这个流程在视频生成领域效果很好但在自动驾驶场景中会暴露出三个问题。第一计算开销过大。未来视频图像的生成涉及到高分辨率像素重建尤其是使用扩散模型或隐空间扩散模型时一次推理的耗时可能达到数百毫秒甚至更久。对实时驾驶来说这个代价很难接受。第二重建目标与驾驶任务不一致。像素级的损失函数会逼迫模型把大量容量花费在纹理、光线、背景等与驾驶决策无关的细节上。车辆是否安全变道未来红绿灯变成什么颜色这些信息确实重要但背景树叶的晃动对规划毫无意义。重建目标让模型学了很多不该学的东西。第三解码后的输出仍然需要再次编码。规划模块很难直接从一张未来图像里提取安全边界。你需要再跑一遍目标检测、语义分割或占用感知才能把“未来画面”转成“可用于决策的信息”。这个二次处理过程既增加时延也引入了新的信息损失。2.2 特征预测的核心思路DF³ 的思路是把“预测未来”和“生成未来”分开。它不做像素重建而是在编码器输出的特征空间中预测未来特征序列然后直接把预测特征送入驾驶任务头。这里的关键不是“不生成画面”这一个表面区别而是整个设计哲学发生了变化默认世界模型是一个任务驱动的中间模块而不是一个独立的内容生成器。DF³ 的名字已经点出了它的两个核心要点。Decoder-Free 意味着在预测未来时不需要额外的解码器也就不需要承担像素重建的高额成本Feature Forecasting 意味着模型的输出是未来的特征表示这些特征天然适合被后续规划、控制或安全模块消费。从更底层的角度看DF³ 其实在回答一个本质问题世界模型到底应该重建“世界本身”还是重建“足够支持决策的世界状态”前者是内容生成视角后者是决策辅助视角。DF³ 选择的是后者。2.3 去掉解码器之后的连锁反应去掉解码器带来的变化是连锁的。训练目标变了。模型不再用未来画面和真实画面之间的重建误差做监督而是用任务损失如轨迹误差、碰撞概率、规划舒适度来反向约束特征预测器。预测出的特征如果不能让任务头做出正确决策无论它在像素层面多逼真都是无效预测。推理流程短了。从传感器到规划输出的完整链路变成感知编码器 → 特征预测器 → 规划任务头。没有“解码成图像”和“再来一次感知”这两个环节整个闭环的时延大幅降低。不确定性表达也变了。生成式模型通常用多帧采样表示未来有多种可能而特征空间预测可以选择直接预测一个分布让任务头在该分布下寻找风险最低的轨迹。这种“面向决策的不确定性”在实际规划中比像素级的多样性更实用。3. 核心概念速览世界模型、特征预测与任务头在继续往下聊架构之前先把几个高频术语讲清楚避免不同语境下的概念混淆。术语通俗解释在 DF³ 中的作用World Model世界模型让系统在内部模拟环境未来变化的模型作为整体框架为导航提供“预演”能力Encoder编码器把图像、点云等观测数据压缩成紧凑特征的模块将当前环境状态转换为特征向量序列Feature Forecasting特征预测在特征空间预测未来若干步的表示替代未来图像重建直接产出时空特征Decoder-Free无解码器不再把特征还原成像素、占用栅格等完整输出省去重建模块降低计算开销与任务偏差Task Head任务头消费特征并输出具体结果的模块例如轨迹规划头、速度控制头、安全风险头Closed-Loop闭环模型预测结果参与控制控制结果影响下一帧输入自动驾驶最终将模型放入真实或仿真闭环运行容易混淆的一点是“Feature Forecasting”并不是一个新概念。近几年不少自监督视频模型已经在做特征预测。DF³ 的差异在于它从一开始就不设置解码器也不以未来特征重构当成最终学习目标而是把特征预测嵌入到完整的自动驾驶任务链路中。它强调的不是“特征预测本身”而是“预测出来的特征可以直接帮助车辆导航”。这也是理解 DF³ 最重要的一点它不是一个单纯的视频预测模型而是一个面向自动驾驶决策的世界模型方案。评价它好不好不能只看未来特征预测得多准而要看整个闭环系统是否规划得更安全、更高效。4. DF³ 的整体架构与关键设计由于我无法访问 DF³ 的最终官方源码这里不针对某个具体网络结构做逐层拆解而是基于论文标题和该技术方向的一贯设计梳理一个合理的整体框架。这套框架也足以支撑你自己做实验或复现思路。从宏观上看DF³ 类模型包含三个核心模块。第一是感知编码器。它接收多帧传感器输入包括环视相机、激光雷达、毫米波雷达等输出一个紧凑的特征序列。实际工程中常用 Bird’s-Eye-ViewBEV特征作为中间表示因为它把多视角观测统一到了自车坐标系方便后续时序建模和规划。编码器可以基于 2D 卷积、3D 卷积或 Transformer具体选择取决于传感器配置和算力平台。第二是时序特征预测器。这是 DF³ 的核心目的是从历史特征序列中预测未来特征。它需要建模障碍物的动态、自车的运动以及场景结构的连续性。常见做法是使用带时序注意力的 Transformer 编码器或者 3D 卷积与 Transformer 混合模块。预测器输出的是一段未来特征序列而不是一张未来图片。第三是任务头。任务头根据预测的未来特征输出具体的驾驶决策。最简单的任务是规划自车未来轨迹输出一系列 x、y 坐标。更复杂的任务还可以包含目标点速度、转向角、危险评估分数等。任务头可以是轻量级 MLP也可以是带交互建模的轨迹优化模块。从设计本质来看DF³ 有三个关键决策值得关注。第一个关键决策是任务损失直接监督特征预测。特征预测器在训练时并非单独训练而是和任务头联合训练。规划结果好与坏会反向影响特征预测器让特征表示中保留“决策真正需要的未来信息”去掉与决策无关的冗余信息。第二个关键决策是保持时间一致性。只用单未来帧的任务损失来约束特征预测很容易导致预测出的特征在不同帧之间跳变。因此训练中通常会加入时序一致性约束例如让连续预测出的特征差异尽可能平滑或者在训练时把真实历史帧替换为预测特征迫使模型自己纠正误差。第三个关键决策是丢弃解码器的条件下保留多模态预测能力。未来道路情况存在多种可能特征预测器需要输出一个分布而不是一个确定性特征。常见的做法是让模型并行预测 K 个未来特征假设再让任务头分别评估每条假设下的轨迹风险。这样即便没有解码器生成图片系统也保留了多模态不确定性建模能力。5. 示意实现用 PyTorch 风格伪代码理解 DF³下面给出教学用示意代码目的是帮助理解模块边界和数据流向不是任何官方实现。实际工程中你需要根据自己的传感器配置、加速平台和任务定义来替换细节。5.1 模型定义# 文件路径df3_demo/model.py import torch import torch.nn as nn import torch.nn.functional as F class PerceptionEncoder(nn.Module): 感知编码器从多帧图像提取紧凑特征。 def __init__(self, in_channels: int 3, feature_dim: int 256): super().__init__() self.feature_dim feature_dim self.backbone nn.Sequential( nn.Conv2d(in_channels, 64, kernel_size3, stride2, padding1), nn.BatchNorm2d(64), nn.ReLU(inplaceTrue), nn.Conv2d(64, 128, kernel_size3, stride2, padding1), nn.BatchNorm2d(128), nn.ReLU(inplaceTrue), nn.Conv2d(128, feature_dim, kernel_size3, stride2, padding1), nn.BatchNorm2d(feature_dim), nn.ReLU(inplaceTrue), ) def forward(self, frames: torch.Tensor) - torch.Tensor: # frames: [B, T, C, H, W] B, T frames.shape[:2] features [] for t in range(T): feat self.backbone(frames[:, t]) features.append(feat) # [B, T, C, H, W] return torch.stack(features, dim1) class FeaturePredictor(nn.Module): 时序特征预测器基于历史特征预测未来特征。 def __init__(self, feature_dim: int 256, future_horizon: int 2): super().__init__() self.future_horizon future_horizon self.gru nn.GRU( input_sizefeature_dim, hidden_sizefeature_dim, num_layers2, batch_firstTrue, ) def forward(self, history_features: torch.Tensor) - torch.Tensor: # history_features: [B, T, C, H, W] B, T, C, H, W history_features.shape # 对空间维度做全局池化方便进入 GRU history_pooled history_features.mean(dim(3, 4)) # [B, T, C] _, hidden self.gru(history_pooled) future_feats [] for _ in range(self.future_horizon): feat, hidden self.gru(history_pooled[:, -1:], hidden) # 这里简化实现将 GRU 输出扩展到空间维度 future_feat feat.unsqueeze(-1).unsqueeze(-1).expand(B, C, H, W) future_feats.append(future_feat) return torch.stack(future_feats, dim1) # [B, T_future, C, H, W] class PlanningHead(nn.Module): 规划头从预测特征中输出未来轨迹。 def __init__(self, feature_dim: int 256, traj_len: int 10): super().__init__() self.traj_len traj_len self.fc nn.Sequential( nn.Linear(feature_dim, 512), nn.ReLU(inplaceTrue), nn.Linear(512, traj_len * 2), ) def forward(self, future_features: torch.Tensor) - torch.Tensor: # future_features: [B, T_future, C, H, W] pooled future_features.mean(dim(3, 4)) # [B, T_future, C] pooled pooled.mean(dim1) # [B, C] traj self.fc(pooled) # [B, traj_len*2] return traj.view(-1, self.traj_len, 2) class DF3Model(nn.Module): DF³ 教学示意模型。 def __init__(self, feature_dim: int 256, future_horizon: int 2): super().__init__() self.encoder PerceptionEncoder(feature_dimfeature_dim) self.predictor FeaturePredictor( feature_dimfeature_dim, future_horizonfuture_horizon ) self.head PlanningHead(feature_dimfeature_dim) def forward(self, frames: torch.Tensor) - torch.Tensor: history_features self.encoder(frames) future_features self.predictor(history_features) trajectory self.head(future_features) return trajectory这段代码使用了一个简化特征预测器先将每帧特征全局池化再用 GRU 建模时序最后扩展回空间尺寸。真实项目中时空特征预测往往需要在 BEV 空间做 3D 卷积或稀疏注意力计算复杂度远高于这个示意。但核心流程是相同的不生成图像只预测特征序列然后直接接规划头。5.2 训练循环示意# 文件路径df3_demo/train.py import torch import torch.nn as nn import torch.optim as optim from df3_demo.model import DF3Model def train_step(model, optimizer, batch, device): frames batch[frames].to(device) # [B, T, C, H, W] gt_trajectory batch[trajectory].to(device) # [B, N, 2] optimizer.zero_grad() pred_trajectory model(frames) # 任务损失规划轨迹与真实轨迹之间的误差 task_loss nn.functional.smooth_l1_loss( pred_trajectory, gt_trajectory ) # 在更完整的实现中还可以添加特征一致性损失 # feature_loss consistency_loss(history_features, future_features) # loss task_loss lambda_feat * feature_loss loss task_loss loss.backward() nn.utils.clip_grad_norm_(model.parameters(), max_norm5.0) optimizer.step() return loss.item() if __name__ __main__: device torch.device(cuda if torch.cuda.is_available() else cpu) model DF3Model(feature_dim256, future_horizon2).to(device) optimizer optim.AdamW(model.parameters(), lr1e-4) # 假设 dataloader 提供多帧图像与未来轨迹 # dataloader build_dataloader(nuscenes) # 示意不实际执行 # for batch in dataloader: # loss train_step(model, optimizer, batch, device) # print(floss: {loss:.4f})这里最值得注意的一点是损失函数完全由任务目标驱动。你甚至可以完全省略像素重建损失因为模型不需要还原未来画面。如果你希望预测的特征保持可解释性可以额外添加视觉特征辅助头但这不是 DF³ 的必要组件。5.3 配置示例下面是一个典型的训练配置示意。实际项目请根据需求调整不要照抄数值。# 文件路径config/df3_demo.yaml data: dataset: autonomous_driving_dataset sensor: camera sequence_length: 5 # 观测历史帧数 future_horizon: 2 # 预测未来帧数 image_size: [480, 640] model: encoder: backbone: resnet50 feature_dim: 256 output_grid: [50, 50] # BEV 特征图尺寸示意 predictor: type: transformer num_layers: 6 num_heads: 8 dropout: 0.1 head: type: mlp hidden_dim: 512 trajectory_length: 20 training: batch_size: 8 learning_rate: 0.0001 weight_decay: 0.01 epochs: 100 task_loss_weight: 1.0 feature_loss_weight: 0.1 grad_clip: 5.0 evaluation: metrics: - planning_l2_error - collision_rate - latency_ms6. 在自动驾驶导航中的应用场景DF³ 这类无解码器特征预测世界模型在自动驾驶导航中有几个非常实际的应用场景。第一个场景是端到端轨迹规划。这也是最直接的应用。模型接收历史帧预测未来特征序列规划头输出连续平滑的轨迹。因为在特征空间里预测系统可以从“未来可能发生什么”和“我该怎么做”之间建立更强的耦合而不是生成一堆图片后再去做二次感知。第二个场景是遮挡推理。真实道路中障碍物经常被路口建筑、大型车辆遮挡。如果模型能基于历史特征预测未来特征它实际上在隐式地表达“这个位置虽然现在看不到但根据上下文它后面可能出现什么”。特征预测天然比单帧感知更有能力做这种推理。第三个场景是闭环仿真与测试。传统仿真器依赖手工构建或离线日志回放难以模拟“自车行为改变后世界如何反应”。DF³ 特征预测器可以作为一个轻量级神经仿真器给定历史观测和假设控制动作预测未来的环境特征供规划器评估。这种闭环仿真对端到端系统的安全验证非常有价值。第四个场景是多模态风险评估。车辆在路口不知道旁边车辆是直行还是转弯。特征预测器可以同时生成若干个未来特征假设规划头针对每一条假设计算碰撞风险和通行代价最终选择风险最小的轨迹。相比生成多张未来图片这种“在特征空间直接评估多条未来假设”的方式更高效、更直接。第五个场景是安全冗余。即便模型预测能力很强自动驾驶系统仍然需要规则层或安全层来防止意外。DF³ 预测出的特征和风险分数可以被安全模块消费用来做紧急刹车或最小风险策略。这里的关键是特征空间的输出必须是可评估、可量化的而不是仅供可视化展示的图片。7. 训练与验证要点7.1 训练数据组织DF³ 训练需要的是连续时间序列数据。基本输入形式是“若干历史帧 对应未来真值”。未来真值可以是车辆未来轨迹也可以是未来传感器观测用于特征或监督。具体构建方式取决于你的任务头。如果任务头是轨迹规划你需要有自车对应的未来轨迹真值。如果任务头是占用网格预测你需要有未来的占用真值。这里的关键是DF³ 虽然不做解码器重建但训练仍然需要某种形式的监督信号。只是这个监督信号来自任务目标而非像素。7.2 损失函数设计推荐的损失函数组合是任务损失预测轨迹与真值轨迹之间的 L1 或 Smooth L1 误差这是主损失。特征一致性损失让预测出的未来特征在时间上尽量连贯避免相邻帧特征跳变。边界惩罚损失可选如果预测轨迹超出道路边界给额外惩罚。任务损失的权重一般最高特征一致性损失作为辅助正则。这样可以避免模型为了降低任务损失而生成不稳定的特征序列。7.3 评估指标评价 DF³ 类模型不能只看特征预测误差。最合理的评估方式至少包含三类指标指标类型示例说明任务指标规划 L2 误差、碰撞率、平顺度直接反映导航效果预测指标未来特征位移误差、显式占用精度反映世界模型本身的预测质量工程指标单次推理耗时、显存占用、帧率决定是否能在车载平台部署在论文汇报或技术评审时应该同时提供开环指标和闭环指标。开环指标常见做法是在离线数据集上计算预测轨迹误差闭环指标则是把模型放入仿真器看自车在连续决策中的成功率、碰撞率和任务完成率。闭环指标更接近真实体验但实现成本更高。7.4 验证步骤建议建议按照以下顺序验证模型单帧静态能力先确认编码器输出的当前特征能支撑规划任务这一步可以暂时关闭特征预测器直接用当前特征规划。开环预测能力开启特征预测器在离线数据上评估未来特征和规划轨迹误差。短时闭环能力在仿真环境中只预测 1 到 2 秒未来验证自车能否稳定跟踪规划轨迹。长时闭环能力逐渐加大预测时域检查误差累积和控制稳定性。这种渐进式验证方式可以帮你快速定位问题是出在感知编码、特征预测还是规划头避免一上来就堆复杂模型最后难以定位瓶颈。8. 工程落地中的常见问题与排查我整理了几个在特征预测类世界模型项目中经常出现的问题供你在实验或部署时参考。问题现象可能原因排查方式解决方案预测特征随时间漂移规划轨迹发散预测误差随预测步长累积分别评估第 1 帧与第 N 帧预测误差训练时把预测特征会写到历史输入中强制模型自我纠错训练很快但闭环性能很差开环训练与闭环部署存在偏差对比开环误差与闭环成功率加入仿真闭环的迭代训练或者使用策略梯度类方法微调特征预测看起来模糊缺乏多模态性模型只学了一个确定性平均结果可视化不同未来假设的特征差异让预测器输出多个未来特征假设并保留对应概率任务头无法区分关键障碍物动态特征维度缺失或时序信息不足检查特征图在车辆附近区域的激活值增加更高分辨率特征分支或使用注意力机制聚焦动态区域推理时显存/耗时超标未来预测在空间维度上开销太大分析模块耗时分布对 BEV 特征做稀疏化处理或用局部注意力代替全局注意力可解释性差无法定位失败原因特征空间缺乏直观语义增加辅助头把特征还原为语义栅格供调试在训练时保留一个可丢弃的解码器用于调试部署时去掉它这里想特别强调“训练时用真实历史测试时用预测特征”造成的分布偏差。这是序列预测类模型最常见的坑。解决办法之一是在训练过程中随机用模型自己的预测特征替换一部分真实历史特征让模型学会在自身误差上做修正。这个技巧在很多视频预测和强化学习模型里都被验证有效DF³ 类模型同样适用。9. 最佳实践与工程建议结合特征预测世界模型的研究和落地经验这里给出一些更偏工程化的建议。第一先用小任务跑通链路再扩大规模。不要一开始就做 10 秒长时预测、多模态高分辨率 BEV 特征。可以先在单一路口场景预测 1 秒未来接一个简单的线性规划头。这条链路跑通后你才真正理解模块之间的数据流和训练技巧。基于“能跑通的最小闭环”扩展比从零搭建大模型再慢慢调效率高得多。第二任务导向设计要贯彻到损失函数和数据集构建。DF³ 的核心是“面向任务的未来特征”。如果你最终目标是规划训练数据就不需要刻意标注未来每一辆车的精确边界框而应该侧重自车轨迹、可行区域和碰撞风险。准备数据时多问一句“这个标注真的会影响驾驶决策吗”能帮你砍掉大量无用标注成本。第三可视化调试是必须的哪怕最终部署版本没有解码器。你可以训练一个独立的辅助解码器只在调试阶段把预测特征还原成 BEV 语义栅格。这样可以直观看到预测的未来是否合理、自车附近有没有出现鬼影、障碍物运动是否连贯。输出到公开版本时再丢掉这个解码器部署模型保持 lightweight。第四考虑安全冗余时不要让特征预测模型独自承担所有风险。任何世界模型都有预测误差特别是在分布外场景。生产系统中应该保留规则层或安全层用雷达、超声等低成本传感器做最终制动兜底。DF³ 的预测特征可以输出一个“风险分数”但这个分数本身可能是错的所以不要把决策完全押在预测结果上。第五建立良好的监控指标。在真实道路部署中除了碰撞率这类终极指标还应该监控特征预测误差的实时估计。比如比较预测的下一帧特征与真实观测到的下一帧特征之间的距离如果这个距离在连续帧上升说明模型正在面临分布外场景系统应该切换到保守驾驶模式。这相当于用可观测的未来帧做在线模型健康检查是非常实用的工程手段。第六版本迭代时保持训练分布稳定。自动驾驶数据采集会有天气、城市、传感器型号的差异。特征分布一旦漂移整个决策链路都会受影响。建议在模型中保留一个轻量级归一化层并在持续训练流程中做特征分布监控。必要时增加新的数据域而不是盲目混合所有历史数据。第七在团队协作中把“特征空间接口”当成一份契约。编码器输出的特征维度、分辨率、坐标语义预测器的时域定义规划头的输入输出格式都要用文档固定下来。特征空间不像图像那样直观一旦某个模块改了输出下游可能悄无声息地失效。写清接口规范、给出示例数据能减少大量协作成本。10. 总结与下一步学习方向DF³ 给自动驾驶世界模型带来的最大启发不是某一种具体网络结构而是一种设计取舍与其生成一个完整的未来世界画面不如只预测足以支撑决策的未来特征。这个取舍在计算成本、任务一致性、闭环部署等多个维度都更符合自动驾驶的实际需求。如果你现在正在做端到端驾驶、轨迹预测或城市导航相关项目我建议你先把文中的示意代码跑通用一个小型数据集验证“编码器 → 特征预测器 → 规划头”这条链路能不能工作。不要急着追求大模型和复杂预测器。先把预测 1 秒未来这件事做好再逐步扩展到更长的时域和更多模态的特征这时候你会对特征漂移、多模态预测和闭环训练产生最直接的体感。阅读 DF³ 这类工作之后值得继续深入的方向还有视频预测与特征预测的结合边界在哪里、连续多帧特征预测的误差传播如何建模、占用网格预测是否可以完全被特征预测替代、以及如何设计更好的闭环评估指标。世界模型在自动驾驶中的落地仍然处在早期阶段Decoder-Free 是一个很有价值的探索方向但它绝不是终点。真正的自动驾驶世界模型大概率会是生成式方法和任务导向特征预测方法的结合体一部分用于生成理解场景的语义一部分用于直接驱动决策。搞清楚 DF³ 把哪一段链路删掉了、为什么能删掉也就理解了世界模型未来演化的一个关键变量。
返回列表