
最近一段时间自动驾驶领域的 VLAVision-Language-Action模型成了大家反复讨论的话题。很多人第一时间想到的是把视觉、语言、动作统一到一个大模型里让车像人一样“看到场景、理解指令、输出动作”。可真正动手做的人会发现这个方向和通用基模预训练之间有一道很深的鸿沟通用基模大致上是大规模图文数据喂出来的而自驾 VLA 需要的是场景、指令、动作轨迹的联合标注前者容易获得后者昂贵且难以标准化。所以当我在 ECCV 2026 相关消息里看到北航和清华提出的 DriveTeach-VLA标题里直接点出“用图像轨迹打通驾驶场景与基模预训练”第一反应是这个思路踩在了关键问题上它想找一种中间表示让驾驶场景能更好地利用基模预训练的知识。这篇文章我想聊聊这个方向为什么值得关注又该警惕哪些坑。1. 先看场景自驾 VLA 的规模化卡在数据和表示上1.1 为什么大家都想用 VLA 做自动驾驶如果你这几年一直在关注智能驾驶应该能感觉到一个明显变化早期的端到端方案更多是把感知、预测、规划模块串到一个神经网络里视觉输入控制输出中间全靠隐向量传递信息。这种方案在小规模场景里能看到效果但一旦遇到复杂交互、长尾场景和开放式指令问题就会暴露出来模型缺少一个结构化的“共同语言”来组织推理。VLA 的思路是把视觉、语言、动作放到同一个大模型框架里训练。语言在这里不只是让人和车对话更重要的是它提供了一种强约束的语义接口。比如“前方路口右转注意行人”这句话既是给模型的指令也把当前任务从“任意驾驶”约束成“右转并避让行人”。这种约束在训练时能帮助模型聚焦到关键目标在推理时也能提供解释入口。理论上只要数据足够多、模型足够大VLA 可以同时学习感知、预测、规划甚至决策原因让整个驾驶系统变得更好迭代。但理想很丰满真正去训练一个自驾 VLA 的人很快会遇到一个尴尬数据规模上不去。通用基模可以用几十亿图文对做预训练图像和文本都是相对容易获取的而自驾 VLA 需要的是视频、语言指令、控制动作、轨迹标注最好还是同一时刻对齐的。这种数据不是普通爬虫能爬到的必须靠真实车队采集、人工标注或规则系统生成。于是很多团队表面上在做一个很酷的统一模型实际上每天都在被数据问题折磨。1.2 基模预训练和驾驶任务之间的错位再看另一个问题就算数据量够了怎么把已预训练好的基模知识搬到驾驶任务上通用基模预训练主要做的事可以简单理解成“学习图像里的语义结构”和“学习语言里的推理模式”。它非常擅长回答“图片里有什么”“东西在哪里”“发生了什么”这一类问题。可自动驾驶最终要输出的是路径、转向、速度这些连续动作。如果让基模直接回归一个坐标向量比如输出(x, y, theta)这个输出空间和它预训练时的视觉特征空间几乎是完全断开的。模型可能要重新学一套与视觉理解无关的映射预训练带来的优势就被削弱了。有人会想那能不能用自然语言描述动作比如“向左变道保持当前速度”把连续动作翻译成离散文本再让模型输出。这个方法确实帮助模型获得了一些语言先验但问题也很明显自然语言无法精确表达细粒度轨迹。道路几何、障碍物距离、时间规划这些信息用文本写出来又长又笨重还容易产生歧义。左侧第二车道还是左侧相邻车道在真实场景里是两种完全不同的路径规划语言稍有含糊模型就会犯错。所以自驾 VLA 的规模化卡点并不是单纯的模型参数量不够而是缺少一种既能保留视觉理解优势又能承载连续动作信息的表示方式。DriveTeach-VLA 的标题让我感兴趣的点正是它试图用一种“图像轨迹”来充当这个表示。这个选择看起来像是在说与其逼着基模讲驾驶的“外语”不如把驾驶任务翻译成它最熟悉的“视觉语言”。2. DriveTeach-VLA 的关键一招把轨迹画在图像里2.1 图像轨迹不是简单的“轨迹可视化”很多人第一次听到“图像轨迹”会觉得这不就是把轨迹画到图像上做可视化吗如果只是可视化那确实没什么可讲的。但结合“打通驾驶场景与基模预训练”这句话来看这里的图像轨迹更像是一种训练和交互的中间表示。具体来说它可能不是把最终轨迹画出来给工程师看而是把未来路径、目标点、速度趋势、转向意图等内容渲染成一系列与图像坐标对齐的视觉符号例如轨迹掩码、带箭头的路径线段、按时间着色的轨迹点或者某种栅格化热度图。模型看到的输入是“一张包含驾驶场景的前视图像 一个问号”要预测的对象不是一串数字而是“叠加在图像上的下一段轨迹图像”。这样做的第一个好处是把动作空间从连续的坐标回归变成了类似分割、检测、关键点预测这类视觉任务。基模在预训练时已经见过大量图像分割、轮廓提取、位置关系判断的样本对“哪里有路、哪里是障碍、哪些区域不允许进入”有很强的先验。当模型需要画出一条路径时它其实是在做一种视觉推理依据车道线、其他交通参与者、交通标志预测未来应该覆盖哪些视觉区域。第二个好处是图像轨迹天然保留了空间对齐关系。坐标回归丢掉的“这个点对应图像上的哪个像素”信息在图像轨迹表示里是一直存在的。模型不需要理解一个抽象坐标系的含义它只需要像看一张标注图一样理解“从车头前方开始向右前方延伸的这条线是未来路径”。这种表示更接近基模预训练的任务分布知识迁移的门槛更低。2.2 为什么这样做能复用基模预训练到这里还需要回答一个更根本的问题图像轨迹如何“打通”基模预训练。通用基模在预训练阶段学到的能力并不仅仅是“把图像变成特征”。它还学会了跨模态对齐、视觉推理、长程依赖建模和常识理解。比如看到一张路口图基模可能已经知道路口的语义结构、车道方向的约定、红绿灯的存在甚至能根据画面中的场景推测下一步会发生什么。这些能力如果直接作用于轨迹预测价值非常大。但是想要让这些能力真正派上用场任务形式必须落在基模熟悉的模式里。图像轨迹恰恰提供了这种模式。你可以把任务设计成给定当前画面和历史轨迹模型需要生成未来轨迹的视觉掩码。这本质上是一个“视觉条件生成”任务和基模预训练时的图像生成、视觉问答、图表理解都有相似之处。更妙的是轨迹图像还可以和自然语言指令结合比如同时输入“前方拥堵准备绕行”这句话和一张当前道路图像模型的输出是一条绕行轨迹图像。这样语言、视觉、动作三个维度都被统一到了“视觉-语言-图像输出”的框架里。从训练角度看这种表示也能更好地利用图文数据。普通自驾 VLA 做预训练时如果只使用驾驶视频缺少语言标注模型很难学到稳定的语义关联如果使用图文对又缺少动作信息。而图像轨迹方案可以让预训练阶段就有“图像 文本指令 轨迹图像”这样的三元组即便不是所有数据都有自然语言标注也可以把轨迹渲染成图像让模型先做视觉轨迹补全或预测。这相当于把一部分动作信息转换成视觉监督大大扩展了可用数据的范围。当然这里说“能打通”更多是逻辑上的推演。具体到网络结构怎么设计、损失函数怎么算、轨迹又如何从图像解码回控制信号标题没有给出细节我也不能替作者补全。但从表示选择本身来看这个方向确实比直接坐标回归更“聪明”。3. 从方法到工程四个必须回答的问题3.1 轨迹的信息量够不够图像轨迹听起来很直观但自动驾驶真正输出给车底盘的不是一张图而是带有时间语义的连续控制量。把轨迹画在图像里首先会遇到信息压缩的问题。二维图像轨迹能表达路径的大致形状、转向点和障碍物相对位置但它很难直接表达速度、加速度、到达时间这类时序信息。你可以在轨迹点里用颜色深浅映射速度也可以用箭头方向和长度表示未来位移可这些毕竟是把连续变量离散化到像素网格里精度会受到分辨率限制。前视图像的像素距离和真实世界不是线性关系远端障碍物在图像里可能只差几个像素但对应到实际横向位移可能已经相差一两米。所以如果 DriveTeach-VLA 最后真的直接输出一张轨迹图它大概率还需要一个解码头从轨迹图里提取连续轨迹坐标再交给下游规划模块。这个解码过程本身又会引入新的误差。更合理的做法可能是双分支结构一个分支做图像轨迹预测用于稳定场景理解和语义推理另一个分支做连续轨迹回归用于精细控制。图像轨迹更像是一种“视觉导师”或辅助监督而不是最终动作的唯一出口。3.2 数据标注成本真的降低了吗标题里提到“用图像轨迹打通驾驶场景与基模预训练”不少人会下意识觉得这种方案可以摆脱昂贵的轨迹标注。但冷静下来看它真正降低的可能是“语言标注”和“动作标签统一”的成本而不是轨迹本身的获取成本。如果训练数据来自真实路采视频轨迹标注通常用自车运动传感器、高精地图或后处理系统自动生成。这个过程已经有成熟 pipeline所以把轨迹渲染成图像的成本确实不高。但关键问题是自动生成的轨迹不一定都是合理或安全的目标轨迹。真实数据里可能出现前车急刹、旁车加塞、红绿灯变化等情况轨迹本身可能带有噪声或者并不代表一个“好司机”的标准答案。如果只做自监督式补全模型很可能会学到一些平庸甚至错误的驾驶模式。如果要进一步提升数据质量比如筛选出“安全且礼貌”的驾驶行为依然需要人工规则或人工评审。也就是说图像轨迹降低的是标注格式的转换成本而不是驾驶行为本身的监督成本。3.3 基模的表示能力能否迁移到驾驶几何空间这是我认为最值得关注的一个问题。基模确实学到了很多视觉语义但它学到的很多“几何”是二维图像空间里的几何并不是自动驾驶真正需要的三维几何、速度束和安全性边界。比如基模非常清楚“一条路消失在路口处”意味着什么但它不太清楚“自车以 60km/h 行驶到这个点需要多长时间”。图像轨迹可以引导模型关注道路结构却很难让模型自动理解车速、距离、时间三者的物理关系。要补上这部分知识可能还需要在模型输入里显式加入自车速度、加速度、当前挡位、目标速度范围等信息。如果没有这些模型预测出的轨迹图像可能视觉上很合理但在物理上完全不可执行。所以基模迁移大概率不是“零样本”完成的。DriveTeach-VLA 如果真的想达到标题里说的“打通”应该还需要设计某种桥接模块把基模的视觉特征和驾驶物理约束连接起来。比如把轨迹预测建模成“在约束图上的逐步规划”而不是简单地让模型自由发挥画线。3.4 怎么样评估才不只是“看着效果不错”图像轨迹有一个很容易误导人的地方结果非常直观。模型输出的轨迹图叠加在真实图像上一眼看去弯路画得对不对、避障有没有绕开外行都能做个粗略判断。但自动驾驶系统评估不能只看“图像轨迹画得漂不漂亮”必须要回到闭环控制效果和长期安全性。评估维度至少应该分成三层开环轨迹精度预测轨迹与传统专家轨迹之间的距离误差包括横向偏差、纵向偏差、最终点误差。这个指标能快速判断模型是否学到了基础行为但容易受数据集分布影响。闭环驾驶指标在仿真器中连续运行看撞车率、压线率、接管的平均里程、是否抵达目标点。这类指标能反映模型在连续控制下的稳定性也会暴露出图像轨迹解码成控制量后的抖动问题。安全边界指标在长尾情况下的表现比如突然出现的行人、极端天气、遮挡、无明确车道线的乡村道路。对自动驾驶来说这类指标才是能否真正上路的关键。如果 DriveTeach-VLA 只在开环轨迹上表现优秀那目前的结论最多是“表示层的迁移有效”。要证明整个方案可以投入真实自驾系统还需要很强的闭环验证结果。从标题看现在还没有足够的公开信息支撑这一点。4. 想在自己的项目里借鉴这个思路先做这三步4.1 第一步构造一个轨迹渲染器即使我们暂时无法复现 DriveTeach-VLA 的完整结构也可以先借鉴“图像轨迹表示”这个思想在现有数据上做一个最小实验。我建议从轨迹渲染器开始。轨迹渲染器的目标是把一段未来轨迹转成与相机图像对齐的视觉掩码。常见做法如下# 示意将轨迹点投影到图像坐标然后画线/画点 # 需要相机内参、外参、自车坐标系下的轨迹点 image_points project_trajectory_to_image( trajectory_worldtrajectory, # [T, 3] camera_intrinsicintrinsic, camera_extrinsicextrinsic ) # 生成一个单通道掩码把轨迹点按时间顺序画上去 trajectory_mask render_trajectory_mask( image_pointsimage_points, image_size(H, W), thickness3, color_by_timeTrue )这里最容易出错的是坐标投影。不同相机有不同的畸变模型内外参标定误差会直接反映在轨迹渲染上。建议先用少量样本做可视化检查确认轨迹线确实压在对应车道上方而不是歪到路边。轨迹的时间信息可以用颜色渐变表示也可以用多个离散点的透明度变化表示。这个选择会影响模型能否感知速度和加速度不要在第一步就丢掉关键信息。4.2 第二步把任务改写成视觉问答或视觉提示形式有了轨迹渲染器之后下一步是把驾驶任务改写成基模熟悉的输入输出形式。这里有两种常见做法第一种是“图像补全/分割”式输入当前图像 自车状态输出未来轨迹的掩码图。这相当于把轨迹预测当成分割任务来做。第二种是“视觉问答式”输入当前图像 文本指令比如“生成下一秒安全路径”模型输出的是轨迹掩码图或者离散路径点再配合一个解码头得到坐标。我更建议先试第二种。因为视觉问答形式更能发挥基模的语义理解能力也方便和现有的图文数据混合。实际操作时可以先用一个已经开源的大型视觉语言模型冻结主干只训练一个轻量级轨迹解码头。这样做的好处是训练成本低跑一次实验很快能帮助我们判断“图像轨迹表示”对这个驾驶数据集是否真的有效。下面是一个简化示例# 伪代码示意如何构造训练样本 instruction 根据当前场景和自车状态预测未来三秒的安全轨迹 image_tensor load_image(camera_frame) # [3, H, W] state_tensor load_state(vehicle_state) # [L, dim] target_mask render_trajectory_mask(...) # [H, W] model_input { image: image_tensor, text: instruction, state: state_tensor, } model_output model(promptmodel_input) loss mse_loss(model_output, target_mask)注意不同基模对输入格式的要求差异很大。有的模型接受的是真正自然语言字符串有的模型接受的是带特殊 token 的多模态输入。如果你用的是开源视觉语言模型一定要先读清楚它的 tokenizer 和图像预处理器不要凭直觉直接拼字符串。4.3 第三步建立从图像轨迹解码回控制量的闭环只输出图像轨迹还不够最终还是要得到可供下游路径规划用的连续轨迹。这里需要设计一个解码模块把模型输出的二维轨迹掩码转换成三维自车坐标系下的轨迹点。常见做法是“峰值提取”。对轨迹热图按每一行或每一列计算概率分布取峰值作为轨迹点再结合相机模型反投影到三维空间最后做平滑和重采样。这个过程听起来简单实际工作中会遇到很多小坑轨迹可能被预测成几条不连续的分支需要做连通域分析图像边缘的轨迹点反投影后可能误差巨大需要设置合理的置信阈值多帧预测之间还会出现抖动需要时序滤波。我建议先把闭环仿真环境搭起来不做太复杂的任务就做“直行-避障-转弯”三个基础场景。在仿真里看模型输出的轨迹图像解码后的轨迹能不能被下游控制器跟踪。这一步能很快暴露图像轨迹表示中丢失时间信息的问题。比如轨迹图像看起来很自然但下游控制追踪时发现速度曲线不合理那就说明需要额外加一个速度预测分支而不是只依赖视觉轨迹。4.4 如果效果不好按这个顺序排查如果按照上面的三步走模型效果依然不理想我建议不要盲目调参按以下链路排查先查轨迹渲染。把训练数据里的图像和轨迹 mask 拿出来一张一张看确认轨迹线和真实道路结构是否对齐。如果渲染时把左右调换或坐标错位了模型再怎么训练也是白学。再查模型输入。基模对图像分辨率、文本长度、状态向量的编码方式都有要求。输入 token 如果超过模型能力一些信息可能被截断需要提前处理。再查损失权重。图像轨迹掩码里大部分像素是背景直接计算 MSE 会让模型倾向于输出全零掩码。要使用加权损失或 focal loss把监督信号集中在轨迹附近。再查数据分布。不同天气、时间段、道路类型会让轨迹形状差异很大。如果训练集里直行场景占 80%模型会倾向于输出一条笔直轨迹而不是真正感知当前场景。最后查评估指标。不要只看一个指标。轨迹图像指标高不代表闭环控制好开环误差低也不代表长尾安全。要结合仿真测试和人工接管率一起看。注意不要一上来就把基模的所有层都解冻训练。先冻结主干、只训练解码头确认“图像轨迹表示”本身是有效的再逐步解冻部分层观察指标变化。这个排查顺序对我处理常见多模态模型任务很实用你也可以把它作为一个通用框架保存下来先看数据是否对齐再看输入是否符合模型预期然后看损失和分布最后看评估方法是否选对了。5. 我的判断图像轨迹可能是自驾 VLA Scaling 的一个务实“翻译器”5.1 这条思路真正改变的是表示方式我之所以对 DriveTeach-VLA 这个方向抱有预期不是因为它提出了一个全新的模型架构而是因为它在“表示层”找到了一个比自然语言更贴合驾驶任务、比坐标回归更贴合基模预训练的中间形态。如果把自动驾驶 VLA 的规模化问题拆开会发现真正的难点不是模型不够大而是任务之间的系统误差太大。语言是离散的轨迹是连续的语言描述语义轨迹描述几何语言很容易从互联网获取轨迹却只能来自驾驶场景。图像轨迹恰好站在两者中间它保留了图像的几何结构又可以被视觉模型当作像素级任务来处理。这就像给一位非常熟悉图像理解的“老师”出了一道他能看懂的考题而不是逼他做一道他从未学过的坐标系代数题。当然这里的“翻译”并不完美。把三维驾驶行为压缩到二维图像轨迹本质上是一种有损表示。但自动驾驶规划本身也不需要每一帧都依赖端到端图像输出图像轨迹可以作为一个中间监督或先验模块与更高频率的传统规划器并行。这样既享受了基模预训练的好处又保留了安全兜底。5.2 最大的风险是安全问题技术讨论到最后还是要回到安全。图像轨迹最让人担心的是它可能“画得好看但错得隐蔽”。基模本质上是一个概率模型它预训练时看过很多“图片里的路径”但不一定理解交通规则背后的物理意义。它可能学到“遇到行人应该绕行”却不一定知道绕行时与行人的最小安全距离是多少它可能画出一条避开当前障碍物的轨迹却没有考虑到下一帧障碍物继续移动后的碰撞风险。这些都是视觉语义模型的通病放到自动驾驶场景里会被放大。所以我认为 DriveTeach-VLA 这类工作真正的落地价值不是让基模直接代替规划器而是让基模成为驾驶系统的“语义感知增强器”。它可以在上游理解复杂场景、生成候选轨迹建议再由传统安全规划器做约束校验和控制。如果你想在实际车辆上使用这个思路一定不要跳过安全层和冗余判断。5.3 给关注这个方向的人一个建议如果你正在做自动驾驶相关的研究或者工作中需要评估新方案能不能采用我建议你做两个小实验再下结论。第一个实验是用公开驾驶数据集做一个“轨迹渲染 基模微调”的快速验证。你不需要复现 DriveTeach-VLA 的全部模块只需要验证一个核心问题给同一个基模分别输入语言指令和图像轨迹监督对比它在驾驶场景理解上的差异。如果图像轨迹监督下的模型在场景理解任务上明显更好说明这个表示方向确实有优势如果差异不大那可能问题不在表示层而在基模本身的能力边界。第二个实验是画一条“数据量-性能”曲线。用 1%、10%、100% 的数据规模分别训练模型看看图像轨迹方案的性能增长斜率是否比传统坐标回归方案更陡。如果更陡说明它确实能更好地利用预训练知识实现 scaling如果更平说明它只是换了一种训练方式并没有真正解决数据效率问题。这两个实验成本都不算高但能帮你把“标题判断”转换成自己的工程判断。自动驾驶 VLA 的规模化故事很多人都在讲但真正值得相信的方案一定是在表示层、数据层和安全层都能对上的方案。DriveTeach-VLA 提供了一条值得尝试路径但最终能不能成为主流还要看它能不能在闭环驾驶中证明自己。如果你最近也在关注自驾 VLA不妨先去找一两个开源驾驶数据集把轨迹渲染器和视觉问答式训练的最小流程跑通。先从不带安全假设的小任务开始一点一点验证“图像轨迹”这个表示在你的场景里到底有多少价值。做完这一步再回头看这篇文章里提到的信息量、评估和安全问题你会有更具体的体感。