目录01 从模块化到“规划导向”的端到端代表算法UniAD02 抛弃栅格拥抱全向量化场景代表算法VAD (Vectorized Scene Representation)03 语言模型的降维打击让车学会“链式思考”代表算法DriveVLM04 走向通用智能一切皆语言的多模态融合代表算法EMMA (End-to-End Multimodal Model for Autonomous Driving)05 最新前沿生成式世界模型代表算法GAIA-1 (Generative AI for Autonomy)06 稀疏化的极致用更少算力做更安全的规划代表算法SparseDrive07 解耦的智慧语言决策与数值控制的完美分工代表算法Senna08 面向量产的护城河拒绝规划轨迹的“左右横跳”代表算法MomAD (Momentum-Aware Planning)09 统一与并行的Transformer打破时序依赖的性能瓶颈代表算法DriveTransformer10 扩散模型的破局用“截断”让生成式规划走向实时代表算法DiffusionDrive11 总结在之前的《自动驾驶核心算法盘点》系列中我们梳理了从 2D/3D 目标检测到目标跟踪再到轨迹预测与规控的经典算法。这些传统的“模块化”架构虽然可解释性强但也面临着信息传递损耗、长尾场景难以穷尽等瓶颈。于是端到端大模型来了——将传感器输入直接映射为驾驶决策用统一的优化目标学习从感知到规划的全链路。端到端自动驾驶这几年发展很快尤其从UniAD获得CVPR 2023 Best Paper之后大量优秀工作涌现。本期选取了该方向上具有代表性的十项工作按照“规划导向—向量化—大语言模型—世界模型—稀疏化—扩散模型”的演进线索做了梳理。在之前的《自动驾驶核心算法盘点》系列中我们梳理了从 2D/3D 目标检测到目标跟踪再到轨迹预测与规控的经典算法。这些传统的“模块化”架构虽然可解释性强但也面临着信息传递损耗、长尾场景难以穷尽等瓶颈。于是端到端大模型来了——将传感器输入直接映射为驾驶决策用统一的优化目标学习从感知到规划的全链路。端到端自动驾驶这几年发展很快尤其从UniAD获得CVPR 2023 Best Paper之后大量优秀工作涌现。本期选取了该方向上具有代表性的十项工作按照“规划导向—向量化—大语言模型—世界模型—稀疏化—扩散模型”的演进线索做了梳理。01 从模块化到“规划导向”的端到端代表算法UniAD核心亮点首个将感知、预测与规划完全融合的端到端网络CVPR 2023 最佳论文。传统的自动驾驶系统通常被拆分为多个独立的模块如感知、预测、规划。这种设计虽然便于工程化团队分工但往往会导致“累积误差”——感知模块的微小偏差传递到规划模块时可能会被无限放大。更重要的是感知模块的优化目标如提高检测框的 IoU并不一定能直接提升最终的驾驶安全性。为了解决这一痛点OpenDriveLab 联合武汉大学与商汤科技提出了 UniADUnified Autonomous Driving。UniAD 的核心哲学是“规划导向”所有的感知和预测任务都不再是孤立的目标而是为了服务于最终的路径规划。UniAD 摒弃了传统的激光雷达仅依靠多视角相机输入在 BEV特征空间下进行处理。它巧妙地设计了五个基于 Transformer 的模块并将其串联TrackFormer负责生成和跟踪交通参与者Agent。MapFormer在线构建道路地图。MotionFormer基于前两者的信息预测每个参与者的未来轨迹。OccFormer预测场景的占用网格Occupancy避免碰撞。Planner综合所有信息输出自车的安全行驶轨迹。通过这种联合优化的方式UniAD 在 nuScenes 数据集上的所有子任务均达到了 SOTA水平其规划的平均碰撞率大幅降低至 0.29%。UniAD 证明了保留中间可解释性表征的端到端架构是通向高级别自动驾驶的可行之路。02 抛弃栅格拥抱全向量化场景代表算法VAD (Vectorized Scene Representation)核心亮点首创全向量化场景表示大幅提升端到端规划的速度与安全性。虽然端到端模型展现出了巨大的潜力但早期的许多方法如基于占据网格 Occupancy 的方法严重依赖于密集的栅格化场景表示。这种密集矩阵计算不仅消耗海量算力而且丢失了车道线、道路边界等关键的“实例级”结构信息这对于安全规划来说是致命的。华中科技大学 hustvl 团队提出的 VAD 给出了一种极为优雅的解法全向量化场景表示。VAD 将复杂的驾驶场景抽象为四种向量边界向量、车道向量、运动向量和自车向量。通过摒弃计算密集的栅格化渲染和繁琐的后处理步骤VAD 直接在向量空间中对自车与环境的交互进行建模。这种设计的优势立竿见影向量化的地图元素和代理运动轨迹可以作为显式的实例级约束极大地提高了规划的安全性。在 nuScenes 测试中VAD-Base 模型的平均碰撞率较前作下降了 29.0%同时推理速度提升了 2.5 倍。其轻量级版本 VAD-Tiny 更是将速度提升了惊人的 9.3 倍为端到端模型在车端芯片上的实时部署铺平了道路。03 语言模型的降维打击让车学会“链式思考”代表算法DriveVLM核心亮点引入视觉语言模型实现类人的 Chain-of-Thought 推理规划。传统的自动驾驶系统在面对结构化道路时游刃有余但一旦遇到长尾的复杂场景例如前方有警车停靠、路面有施工锥桶、甚至有动物横穿往往会显得“不知所措”。这是因为传统的感知网络只能识别预定义类别的物体缺乏对开放世界常识的理解。清华大学 MARS Lab 联合理想汽车提出的 DriveVLM发表于 CoRL 2025创新性地将强大的大视觉语言模型引入了自动驾驶系统。DriveVLM 模仿了人类驾驶员的认知过程提出了一套独特的三阶段“链式思考”模块场景描述识别环境、天气、路况以及关键物体如“前方有一辆闪灯的警车”。场景分析理解这些物体的意图及其对自车的潜在影响如“警车停在右侧可能阻挡车道”。层次化规划先做出高层决策如“减速并向左微调”再输出具体的轨迹航点。考虑到 VLM 目前的推理延迟还无法满足自动驾驶极高的实时性要求团队还贴心地设计了 DriveVLM-Dual 混合架构。该架构将 VLM 的低频深度思考与传统感知规划系统的高频实时控制相结合既保证了对复杂场景的理解力又兼顾了系统的实时安全性。04 走向通用智能一切皆语言的多模态融合代表算法EMMA (End-to-End Multimodal Model for Autonomous Driving)核心亮点Waymo 出品基于 Gemini 基础模型将传感器数据直接映射为驾驶轨迹。如果说 DriveVLM 是在传统架构上“外挂”了一个聪明的 VLM 大脑那么 Waymo 最近推出的 EMMA 则是在架构底层实现了真正的多模态统一。EMMA 构建在强大的 Gemini 多模态大模型之上其最激进的设计在于它将所有非传感器的输入如导航指令、自车状态和所有的输出如规划轨迹、3D 目标位置全部表示为自然语言文本。这种“一切皆语言”的统一空间表示让 EMMA 能够充分榨取预训练大模型中蕴含的丰富“世界知识”。在面对同一个模型时只需输入不同的任务提示词PromptEMMA 就能联合处理运动规划、3D 目标检测以及道路图构建等多种任务。Waymo 的实测数据表明这种多任务联合训练产生了奇妙的“化学反应”——规划、检测和建图三个任务的性能都得到了共同提升。EMMA 在 nuScenes 和 Waymo 开放数据集上均展现出了极强的竞争力并能输出详细的“驾驶理由”为黑盒的端到端模型提供了难能可贵的可解释性。05 最新前沿生成式世界模型代表算法GAIA-1 (Generative AI for Autonomy)核心亮点90 亿参数的生成式世界模型理解物理规律并预测未来。自动驾驶面临的最大挑战之一是如何预测自车采取不同动作后周围世界将如何演变。为了解决这个问题总部位于伦敦的自动驾驶新锐 Wayve 提出了一个宏大的愿景构建自动驾驶的世界模型。GAIA-1 就是这一愿景的初步结晶。它拥有 90 亿参数是一个专门为自动驾驶设计的生成式 AI 模型。与传统的预测模型不同GAIA-1 接收过去的视频序列、文本指令和自车动作作为输入并将其全部映射为离散的 Token。随后它像 ChatGPT 预测下一个单词一样去预测未来的视频帧 Token。在这个看似简单的“预测下一个画面”的过程中GAIA-1 涌现出了令人惊叹的能力。它不仅学会了车辆和行人的运动学规律理解了道路的 3D 几何结构甚至掌握了红绿灯变化等场景动态逻辑。GAIA-1 能够生成高度逼真的未来驾驶视频这不仅为自动驾驶系统提供了一个极其强大的“仿真模拟器”用于无风险训练更标志着 AI 正在真正理解我们所处的物理世界。06 稀疏化的极致用更少算力做更安全的规划代表算法SparseDrive核心亮点首创“稀疏中心”端到端范式彻底摒弃密集 BEV 特征图大幅降低推理延迟。随着端到端模型复杂度的增加计算资源的消耗成为了车端部署的最大拦路虎。尽管 VAD 引入了向量化表示但其底层依然依赖于密集的特征图提取。地平线机器人团队提出的 SparseDrive 则将这一思路推向了极致不仅要向量化更要完全稀疏化。SparseDrive 的核心在于它将所有的驾驶元素动态的车辆行人、静态的车道线全部表示为稀疏的实例Sparse Instances。在整个网络的前向传播过程中不再构建任何稠密的 BEV 特征图。这种“稀疏中心”的设计带来了两个显著优势极致高效计算量与场景中的实例数量成正比而非与感知范围的面积成正比极大地降低了推理延迟。聚焦关键信息注意力机制只在关键实例之间交互避免了大量背景噪声的干扰。在 nuScenes 评测中SparseDrive 在保持与主流稠密模型相当的安全性能甚至在某些指标上更优的同时显著提升了推理速度为端到端大模型的轻量化量产提供了一个极具潜力的解法。07 解耦的智慧语言决策与数值控制的完美分工代表算法Senna核心亮点巧妙解耦 VLM 的高层语义决策与 E2E 模型的低层数值规划。将大语言模型LLM/VLM引入自动驾驶是当前的绝对热点如前文的 DriveVLM但人们很快发现了一个尴尬的事实语言模型很懂常识但它真的不擅长做精确的数学计算。如果你让一个 VLM 直接输出具体的方向盘转角或 XY 坐标轨迹它往往会产生较大的误差。Senna 给出了一种极为务实的工程解法决策与控制解耦。Senna 系统由两个核心模块组成Senna-VLM 和 Senna-E2E。Senna-VLM 充当“大脑”它接收多视角图像理解复杂的交通场景如红绿灯状态、行人意图并输出自然语言的高层驾驶决策例如“前方红灯保持直行并减速停车”。Senna-E2E 则充当“小脑和手脚”它接收 VLM 的高层决策作为条件输入利用其强大的空间几何建模能力输出精确的数值轨迹。通过在大规模数据集 DriveX 上进行预训练并在 nuScenes 上微调Senna 的规划误差降低了 27.12%碰撞率更是大幅下降了 33.33%。Senna 证明了在现阶段让语言模型做它擅长的语义推理让专用网络做它擅长的数值计算是提升端到端系统鲁棒性的最佳路径。08 面向量产的护城河拒绝规划轨迹的“左右横跳”代表算法MomAD (Momentum-Aware Planning)核心亮点引入“动量”机制解决端到端模型帧间轨迹不一致的量产痛点。在学术界的公开数据集如 nuScenes上许多端到端模型都能跑出极低的安全碰撞率。但当工程师将这些模型部署到实车上时往往会遭遇一个致命问题规划轨迹的帧间抖动Temporal Inconsistency。由于端到端模型通常是“单帧感知单次预测”上一帧模型决定向左变道下一帧可能因为光线变化或遮挡突然决定向右回正。这种轨迹的“左右横跳”会导致实车控制极度不稳定乘坐体验极差。为了解决这一面向真实量产的核心痛点地平线联合清华大学等机构提出了 MomADMomentum-Aware Driving该工作已被 CVPR 2025 接收。MomAD 巧妙地借用了物理学中的“动量”概念1.轨迹动量Trajectory Momentum在生成当前帧的轨迹时不仅考虑当前的传感器输入还强制参考上一帧规划的轨迹趋势使其保持惯性避免突变。2.感知动量Perception Momentum在特征提取层通过历史特征的平滑更新缓解单帧图像中目标被短暂遮挡带来的感知丢失。通过这套动量感知机制MomAD 在 nuScenes 数据集上不仅取得了 SOTA 的规划精度更重要的是其轨迹平滑度Smoothness和帧间一致性得到了质的飞跃。MomAD 代表了当前端到端研究正在从“刷榜”向“真实量产落地”务实转变的趋势。09 统一与并行的Transformer打破时序依赖的性能瓶颈代表算法DriveTransformer核心亮点纯 Transformer 的并行端到端范式消除感知-预测-规划的级联依赖大幅提升扩展性与训练稳定性。尽管 UniAD 等工作实现了端到端的联合优化但它们在内部架构上仍然保留了“感知 →\rightarrow→ 预测 →\rightarrow→ 规划”的时序级联Sequential依赖。这种级联结构不仅导致前序模块的误差容易在后序模块中累积还限制了模型的并行计算效率增加了Scaling up的难度。为了解决这一问题上海交通大学团队提出了 DriveTransformerICLR 2025。该工作彻底抛弃了传统的级联范式提出了一种完全并行的纯 Transformer 架构。DriveTransformer 的核心创新在于任务并行化Task Parallelism与稀疏表示Sparse Representation统一并行交互检测、预测、建图和规划的所有 Query 不再按顺序执行而是被统一放置在一个 Transformer 块中。它们在同一层级直接与原始传感器特征Sensor Cross-Attention交互并相互之间进行自注意力交互Task Self-Attention。流式时序融合抛弃了沉重的稠密 BEV 时序融合采用轻量级的 Query 记忆队列Memory Queues传递历史信息实现了高效的流式处理Streaming Processing。这种高度统一且并行的架构不仅极大地简化了端到端系统的设计避免了误差累积还展现出了卓越的训练稳定性。在 Bench2Drive 闭环仿真和 nuScenes 开环测试中DriveTransformer 均取得了 SOTA 性能并保持了较高的运行帧率。10 扩散模型的破局用“截断”让生成式规划走向实时代表算法DiffusionDrive核心亮点通过引入多模态锚点与截断扩散过程将去噪步数减少 10 倍实现 45 FPS 的实时扩散生成规划。近年来扩散模型在机器人策略学习中展现出了强大的多模态动作生成能力。然而将其直接应用于自动驾驶规划却面临着致命的挑战扩散模型需要数十次迭代去噪计算极其缓慢根本无法满足自动驾驶实时性的要求。DiffusionDriveCVPR 2025为这一难题提供了一个极其巧妙的解法截断扩散Truncated Diffusion。DiffusionDrive 放弃了从纯高斯噪声开始去噪的传统做法。相反它首先利用一个轻量级的网络预测出几条粗略的、代表不同驾驶意图的“锚点轨迹”。然后在这些锚点轨迹的基础上添加适量的噪声构建一个锚点高斯分布。扩散过程不再是从 TTT纯噪声开始而是被截断直接从中间的某个步骤开始去噪。这种“站在巨人肩膀上”的去噪方式使得 DiffusionDrive 仅需 2 步去噪 就能生成高质量、多模态的驾驶轨迹去噪步数比传统方法减少了 10 倍在 NAVSIM 数据集上DiffusionDrive 创下了 88.1 PDMS 的新纪录并在单张 RTX 4090 上实现了 45 FPS 的实时运行速度。它证明了经过合理设计的扩散模型完全可以成为复杂真实世界中高效且可扩展的自动驾驶规划器。11 总结上述工作共同揭示了当前端到端研究的几条主线其一感知与规划的联合优化仍是提升系统上限的核心手段其二大语言模型所携带的开放世界知识正在成为处理长尾场景的重要补充其三生成式世界模型为闭环训练和仿真评测提供了新的技术路径。当然端到端方案目前在可解释性、安全边界的形式化验证以及极端场景的泛化性上仍存在明显局限距离大规模量产落地还需要在工程可靠性与系统安全性上持续投入。参考文献[1]: # Hu, Y., et al. (2023). Planning-oriented Autonomous Driving. CVPR 2023. (UniAD)[2]: # Jiang, B., et al. (2023). VAD: Vectorized Scene Representation for Efficient Autonomous Driving. ICCV 2023. (VAD)[3]: # Tian, X., et al. (2025). DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models. CoRL 2025. (DriveVLM)[4]: # Hwang, J.-J., et al. (2024). EMMA: End-to-End Multimodal Model for Autonomous Driving. arXiv:2410.23262. (EMMA)[5]: # Wayve. (2023). GAIA-1: A Generative World Model for Autonomous Driving. arXiv:2309.17080. (GAIA-1)[6]: # Sun, W., et al. (2024). SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation. arXiv:2405.19620. (SparseDrive)[7]: # Jiang, B., et al. (2024). Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving. arXiv:2410.22313. (Senna)[8]: # Song, Z., et al. (2025). Dont Shake the Wheel: Momentum-Aware Planning in End-to-End Autonomous Driving. CVPR 2025. (MomAD)[9]: # Jia, X., et al. (2025). DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving. ICLR 2025. (DriveTransformer)[10]: # Liao, B., et al. (2025). DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving. CVPR 2025. (DiffusionDrive)