VLA 技术调研本文系统梳理 VLAVision-Language-Action Model这一贯穿具身智能与自动驾驶两大领域的下一代范式从概念定义、技术挑战到代表性模型RT-2、OpenVLA、Helix、π0、CoVLA、OpenDriveVLA 等再到国内外行业进展理想、小鹏、元戎、小米。1. 概览1.1 什么是 VLA与 VLM / LLM、端到端之间的关系核心差异将 Action动作作为模型的直接输出。VLAVision-Language-Action Model是一种融合视觉感知、语言理解和动作执行的多模态大模型旨在通过类人思维链推理Chain of Thought, CoT实现与物理世界的智能交互。其核心目标是将 AI 从被动辅助工具升级为主动生产工具在自动驾驶、机器人等领域实现高度拟人化的决策与执行能力。三者结构差异模型类型输入输出典型用途LLM文本文本问答、写作、代码VLM图像 文本文本图像理解、视觉问答VQAVLA图像 文本 传感器动作连续/离散机器人控制、自动驾驶轨迹LLM : Text ──► Text VLM : Vision Text ──► Text VLA : Vision Text (Sensor) ──► Action关节角度 / 轨迹 / 控制信号与端到端的关系VLA 是端到端的极致——从原始感知直接到动作输出中间不依赖人工设计的模块如感知→预测→规划→控制的串行 pipeline。传统端到端是端到端 CNN/TransformerVLA 是端到端多模态大模型。1.2 为什么一定要选择 VLA没有一定它是一种螺旋式发展的趋势。支撑它走上舞台的两个原因上限更高统一架构 大规模预训练理论能力天花板远高于分模块方案技术成熟度到了2023.7 Google 推出 RT-2 才受到大家关注背后是 diffusion / transformer 等基础技术的成熟判断标准新技术发展有不确定性。当基础技术多模态预训练、scaling law、扩散模型成熟到一定程度VLA 这种看起来激进的方案才会从论文走进量产。1.3 有哪些挑战和阻碍以智驾场景为例VLA 不成熟的核心原因可以归纳为三点数据少、模态对齐难、复杂度高。下面以车的场景为例展开。训练数据少Vision(pic, sensor, last_action) - next Action这种成对的数据极度稀缺模态对齐Vision时序、Action 的对齐是难题复杂度高把感知 推理 控制集成到一个模型里训练和推理代价陡增1.3.1 数据不足量级与多样性不足数据量级远不及训练视觉-语言模型VLM的数据且多样性严重不足多采集于简单环境。存在数据不足限制模型能力、模型能力有限制约数据采集的恶性循环。数据采集难题在实际应用中获取高质量、多样化且适用于 VLA 训练的数据存在困难阻碍模型性能提升。破局思路仿真数据DriveDreamer4D、DrivingSphere 网络视频预训练GR-2、π0 真实数据精调三位一体。1.3.2 多模态对齐涉及图像、时序、3D 空间、动作的对齐图像、语言和动作是异质模态表示空间不同步输入变化极大比如按钮视觉变化、语言歧义难以正确对齐动作输出时序和空间理解要求高尤其在操作中必须精准定位 预测动作时机1.3.3 复杂度升高三模态联合建模 长时序推理导致模型参数爆炸、推理速度变慢训练流程需要同步图像处理、语言理解、动作预测pipeline 复杂模型难以部署在低功耗设备或实时任务场景中2. 典型模型架构2.1 技术分类按动作表征方式和基座类型分类VLA 大致有四条技术路线路线代表模型动作表征特点离散化 Action TokenRT-2、OpenVLA把动作转为文本 token复用 VLM 架构但精度受限扩散头 Actionπ0、Diffusion-VLA、RDT-1B用扩散模型生成连续动作高维连续控制强慢Flow Matchingπ0、Helix流匹配生成动作比 diffusion 快质量高双系统快慢脑Helix、DP-VLASystem1 快反射 System2 慢推理兼顾实时性和推理深度2.2 开山之作RT-2 框架2023.7 谷歌 DeepMind 推出了一款新的机器人模型Robotics Transformer 2 (RT-2)。RT-2 模型的核心创新点主要体现在模型架构设计和能力突破两方面通过融合互联网级视觉-语言数据与机器人控制实现了机器人泛化能力和语义推理能力的显著提升。论文《RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control》2.2.3 创新点视觉-语言-动作模型VLA的统一表示1. 动作文本化编码将机器人的动作如关节角度、末端执行器指令等转化为文本 tokens与自然语言指令、视觉信息统一输入模型。例如将移动机械臂至坐标 (x,y,z)表示为特定文本序列优势无需为动作设计独立的解码模块直接复用视觉-语言模型如 PaLM-E的现有架构简化训练流程并增强跨模态对齐能力。2. 联合微调策略在训练阶段同时使用机器人轨迹数据如操纵物体的动作序列和互联网级视觉-语言任务如视觉问答、图像描述。目标通过大规模非结构化数据网页图文增强模型的语义理解能力同时通过机器人数据保留控制精度。工程启示RT-2 把动作统一到语言空间是 VLA 第一次能复用 LLM 生态的关键。代价是离散化动作损失精度后续 π0/Helix 都是为了解决这个。2.3 OpenVLA首个完全开源的 VLA 模型丰田、谷歌、斯坦福、UC 伯克利合作的OpenVLA公布于 2024 年 3 月于 2024 年 6 月 13 日正式发布。关键参数70 亿参数7B在97 万真实机器人演示数据上训练基于Llama 2 语言模型 融合DINOv2 SigLIP预训练特征的视觉编码器构建性能突破在 29 项任务中绝对任务成功率比RT-2-X550 亿参数高 16.5%参数少 7 倍在多任务环境泛化和语言接地能力表现强优于Diffusion Policy 20.4%可通过现代低秩适应方法LoRA在消费级 GPU 上微调经量化后可高效部署开源了模型检查点、微调笔记本和 PyTorch 代码库支持在 Open X-Embodiment 数据集大规模训练 VLA 模型创新点打破封闭生态现有主流 VLA 模型如 RT-2、RT-2-X多为企业闭源方案公众无法获取模型参数或代码。OpenVLA 首次开源 70 亿参数的 VLA 模型并提供完整训练框架推动学术界和工业界对 VLA 的研究与应用。降低技术门槛开源资源模型检查点、微调笔记本、PyTorch 代码库使开发者无需从头训练可直接基于预训练模型快速定制机器人技能加速技术落地。2.4 OpenDriveVLA面向端到端自动驾驶的 VLA论文《OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model》—— Technical University of Munich这是一种专为端到端自动驾驶设计的视觉-语言-动作VLA模型其核心思想是通过融合视觉感知、语言理解和动作生成能力实现基于环境语义的端到端自动驾驶决策。关键技术创新层次化视觉-语言对齐提出一种层次化对齐方法将 2D 图像视觉特征和 3D 结构化视觉标记如激光雷达点云生成的 BEV 特征投影到统一语义空间解决驾驶视觉表征与语言嵌入之间的模态差异使模型能将视觉感知与语言指令直接关联。自回归代理-环境-自车交互建模通过自回归机制建模自车、周围智能体如其他车辆、行人和静态道路元素之间的动态关系确保轨迹规划同时考虑空间位置如避免碰撞和行为逻辑如遵守交通规则、预测其他车辆意图实现更安全、合理的路径规划。2.5 Helix通用人形机器人 VLAFigure.AI2025 年 2 月 20 日智能机器人公司Figure.AI发布的 VLA 模型《Helix: A Vision-Language-Action Model for Generalist Humanoid Control》。它是典型的快慢双系统也是最接近量产的机器人 VLA 系统。Figure.AI 在机器人领域的地位近似于 OpenAI 在 LLM 领域内的地位。Helix 有五大神奇之处快RT-2 论文里提到的决策频率只有 1~5 Hz更没法做到 200 Hz 的操作速度。Helix 的上一代 Figure 01 借助基于简单神经网络的机器人操控小模型做到了以200 Hz的频率生成24-DOF动作。Helix 进一步提升到35 自由度而 RT-2 还是 6 自由度。简单就一个大模型通过自然语言就可得到最终的 Action。训练效率高现有的 VLA 系统通常需要专门的微调来优化不同高级行为的性能Helix 则不用。泛化能力强Helix 直接输出高维动作空间的连续控制避免了先前 VLA 方法如 RT-2、OpenVLA使用的相对简单的离散化动作 tokenization 方案——这些方案虽取得一些成功但在高维人形控制中面临扩展挑战。所需训练数据少收集了高质量的多机器人、多操作员数据集包含各种远程操作行为仅使用约500 小时的高质量监督数据训练 Helix而一般的 VLA 预训练数据集一般 1 万小时起步。关键洞察Helix 的少数据高效果靠的是数据质量 架构效率连续动作 双系统而非堆数据。这对机器人方向是颠覆性的——意味着中小团队也能训练人形机器人 VLA。2.6 A Dual Process VLA双过程 VLADP-VLA论文《A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM》这篇文章提出了一种双过程视觉-语言-动作模型DP-VLA旨在解决现有 VLA 模型在实时性能方面的计算瓶颈问题。其设计灵感源自卡尼曼的快思考/慢思考System 1快VLM 主干处理高频常规操作System 2慢仅在遇到复杂场景时触发深度推理2.7 CoVLA面向自动驾驶的大规模 VLA 数据集论文《CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving》核心创新点聚焦于构建大规模多模态数据集与开发端到端自动驾驶模型旨在解决自动驾驶中长尾场景的复杂推理与规划问题。技术关键点1. 提出 CoVLA 数据集首个融合视觉-语言-动作的大规模自动驾驶数据集多模态数据融合与规模突破包含10,000 个真实驾驶场景总计超 80 小时视频涵盖城市道路、高速公路、雨天、夜间等多样化环境。每个场景同步整合前视摄像头视频1080p, 20Hz、车载传感器数据GNSS、IMU、CAN 总线并标注逐帧语言描述与未来 3 秒轨迹动作60 帧全球坐标系下的 (x,y,z) 坐标。原始数据规模达1000 小时以上经筛选后形成高质量子集远超现有同类数据集如 BDD-X、DRAMA 等的规模与标注密度。自动化标注与字幕生成 pipeline轨迹标注通过卡尔曼滤波融合 GNSS/IMU 数据自动生成高精度轨迹并通过启发式方法剔除异常值。目标检测采用传感器融合技术雷达 摄像头检测前车结合专用模型OpenLenda-s识别交通灯状态含箭头信号。自动字幕生成规则基字幕基于车速、加速度、转向角等参数生成结构化描述。VLM 基字幕利用 VideoLLaMA 2 模型处理视频片段60 帧窗口采样 8 帧生成包含时空信息的自然语言描述如天气、风险提示。幻觉抑制以规则基字幕为事实约束引导 VLM 补充细节如窄路湿滑路面减少虚构内容。数据多样性与平衡性通过逆经验分布采样策略平衡车速、转向角、信号灯等特征的分布避免数据偏斜。2. 开发 CoVLA-Agent基于 VLA 模型的可解释端到端自动驾驶系统模型架构创新融合CLIP 视觉编码器提取图像特征、Llama-2 语言模型处理文本指令与推理、MLP 层整合车速等数值信号实现图像输入→语言描述 轨迹预测的端到端输出。引入轨迹查询特殊令牌通过 LLM 生成未来 3 秒的 10 个轨迹点结合均方误差MSE损失优化预测精度。多任务联合训练同时训练场景描述生成与轨迹预测任务通过加权交叉熵与 MSE 损失联合优化强化语言与动作的一致性。性能验证与可解释性使用真实字幕ground truth caption时轨迹预测的平均位移误差ADE为0.814 米最终误差FDE为1.655 米显著优于使用预测字幕的结果ADE0.955, FDE2.239。2.8 DriveDreamer4D世界模型做 4D 驾驶场景数据机器理想论文《DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation》—— 理想汽车这篇文章提出了DriveDreamer4D框架通过融合自动驾驶世界模型的先验知识提升了 4D 驾驶场景表示能力为自动驾驶闭环仿真提供了更真实、多样的场景模拟方案。2.8.1 研究背景与问题闭环仿真需求端到端自动驾驶系统需要闭环仿真来评估算法但现有方法如 NeRF、3DGS依赖正向驾驶场景的训练数据难以渲染变道、加减速等复杂操作。世界模型的局限现有自动驾驶世界模型虽能生成多样驾驶视频但仅输出 2D 视频缺乏捕捉动态环境时空一致性的能力。2.8.2 核心方法DriveDreamer4D 框架新颖轨迹视频生成模块NTGM利用世界模型作为数据机器通过调整驾驶动作如转向角、速度生成新轨迹并结合结构化条件3D 边界框、高精地图控制交通元素的时空一致性解决复杂场景数据不足的问题。表亲数据训练策略CDTS融合时间对齐的真实与合成数据训练 4D 高斯 splatting4DGS模型引入正则化损失确保感知一致性缩小数据分布差异提升模型泛化能力。2.9 DrivingSphere构建高保真 4D 闭环仿真世界理想论文《DrivingSphere: Building a High-fidelity 4D World for Closed-loop Simulation》—— 理想汽车论文提出DrivingSphere框架旨在构建高保真闭环自动驾驶仿真环境。其核心通过动态环境合成模块生成包含静态背景与动态物体的4D 占据网格世界并利用视觉场景合成模块将其转化为时空一致的多视角视频。相比传统开环仿真和闭环仿真DrivingSphere 具备丰富模拟粒度包含建筑、植被等非交通元素物理空间真实性精确建模 4D 空间交互高视觉一致性ID 感知编码确保跨帧跨视角连贯实验表明其在视觉保真度FVD 指标 103.42、开闭环评估PDMS 0.742RC 11.7%等方面显著优于 MagicDrive、DriveArena 等基线方法有效缩小模拟与真实环境的域差距。2.10 π0基于 Flow Matching 的开源 SOTAPhysical Intelligence2024 年 Physical Intelligence 发布的 VLA 模型π0基于 transformer 流匹配flow matching架构当前开源领域最强的 VLA 模型之一。π0 的关键设计统一动作头用 flow matching 替代 diffusion policy推理更快、训练更稳跨本体训练同一模型控制多种机器人本体机械臂、人形、移动底盘灵巧操作能完成叠衣服、装盒子等长程复杂任务3. 行业进展3.1 理想汽车理想在 VLA 方向的投入是国内车企最深的相关论文涵盖了从数据、重建、规划到模型的全栈参考链接GTC 2025 报告https://static.rainfocus.com/nvidia/gtcs25/sess/1727430977700001r2OJ/FinalPresPDF/S72557_1742210910032001XQ6j.pdf理想 VLA 相关论文清单GaussianAD: Gaussian-Centric End-to-End Autonomous DrivingGeneralizing Motion Planners with Mixture of Experts for Autonomous DrivingPreliminary Investigation into Data Scaling Laws for Imitation Learning-Based End-to-End Autonomous DrivingStreetCrafter: Street View Synthesis with Controllable Video Diffusion ModelsBalanced 3DGS: Gaussian-wise Parallelism Rendering with Fine-Grained TilingReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online RestorationDrivingSphere: Building a High-fidelity 4D World for Closed-loop SimulationDriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation3.2 小鹏小鹏汽车在新 X9 发布上市之前做了一场 AI 技术分享会再次强调了自己是一家AI 驱动的技术公司。这次技术分享会的核心内容之一小鹏正在研发 VLA 基座模型也在研发世界模型而且小鹏汽车已经拥有10 EFLOPS的算力。可以说小鹏汽车整个智驾技术路线也已经向业界下一代主流路线 VLA 开始迭代。 reportedly 用2 亿 Clips 训练 720 亿超大规模模型。3.3 元戎启行元戎启行更进一步于2025 年 1 月 22 日宣布与某头部车企合作基于英伟达 Thor 芯片推出 VLA 量产车型计划年内交付消费者。元戎还透露将在 Robotaxi 领域探索 VLA 应用。3 月 30 日在百人会智能汽车创新技术与产业论坛上元戎启行 CEO 周光表示已完成 VLA 模型多模态的视觉语言动作模型的道路测试并将基于 VLA 模型打造全系列的智能驾驶系统产品涵盖激光雷达方案与纯视觉方案适配多种芯片平台预计今年将有超5 款搭载 VLA 模型的车型进入消费者市场。周光认为VLA 模型作为当下最先进的技术使汽车成为了 AI 智能体在需求暴涨的背景下VLA 模型将重塑市场格局。参考元戎启行今年将有超5款搭载VLA模型的车型进入消费者市场3.4 小米2025 年 3 月中旬小米汽车与华中科技大学联合发表论文《ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation》提出了一种全新的端到端自动驾驶框架 ORION旨在解决现有方法在闭环评估中因果推理能力不足的问题。核心内容1. 研究背景与挑战端到端自动驾驶的瓶颈传统端到端方法在闭环评估中因因果推理能力有限难以做出正确决策。尽管视觉语言模型VLM具备强大的理解和推理能力但其语义推理空间与动作空间的数值轨迹输出存在鸿沟导致闭环性能不佳。现有方法的缺陷直接文本输出VLM 不擅长数值推理且自回归机制无法处理人类规划的不确定性。元动作辅助VLM 与经典端到端方法解耦无法协同优化轨迹和推理过程。行业观察小米 ORION 与理想 MindVLA 的技术路线之争本质是VLM 内嵌动作头还是VLM 外挂元动作的路线分歧。4. 结论 —— 个人观点最后给出对 VLA 整体方向的几个判断VLA 一定不是终极技术—— 它是当前阶段把多模态感知 推理 控制统一到 Transformer 架构下的最优解但绝不是终态。下一代的世界模型 强化学习很可能颠覆当前 VLA 范式。数据Input, action是 VLA 最大的挑战—— 算法已经不是瓶颈数据才是。Vision, Instruction, Action三元组的采集成本远高于Text或Image, Text。谁能低成本、大规模、高质量地生产这种数据谁就能赢。VLA 是上层技术最终比拼的还是对人、车、场的建模准确度—— 模型再大对场景物理规律、驾驶常识、机器人动力学的建模不准照样开不了车、抓不起杯子。基础的世界建模world model才是 VLA 真正的地基。5. 参考文献关键 Paper机器人领域的 VLA 开山之作 RT-2 框架[2307.15818] RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control《RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control》PDFhttps://robotics-transformer2.github.io/assets/rt2.pdfOpenVLAAn Open-Source Vision-Language-Action Model[2406.09246] OpenVLA: An Open-Source Vision-Language-Action Model主页OpenVLA: An Open-Source Vision-Language-Action ModelA Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM[2410.15549] A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLMHelix: A Vision-Language-Action Model for Generalist Humanoid ControlHelix: A Vision-Language-Action Model for Generalist Humanoid ControlA Survey on Vision-Language-Action Models for Embodied AI[2405.14093] A Survey on Vision-Language-Action Models for Embodied AISurvey on Vision-Language-Action Models[2502.06851] Survey on Vision-Language-Action ModelsOpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model[2503.23463] OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action ModelCoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous DrivingCoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous DrivingTowards Generalist Robot Learning from Internet Video: A Survey[2404.19664] Towards Generalist Robot Learning from Internet Video: A Survey小米 ORION[2503.19755] ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action GenerationVLA 其他相关论文速递Learning Fine-Grained Bimanual Manipulation with Low-Cost HardwareOpenVLA: An Open-Source Vision-Language-Action ModelTOWARDS SYNERGISTIC, GENERALIZED AND EFFICIENT DUAL-SYSTEM FOR ROBOTIC MANIPULATIONπ0: A Vision-Language-Action Flow Model for General Robot ControlRDT-1B: A DIFFUSION FOUNDATION MODEL FOR BIMANUAL MANIPULATIONGR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot ManipulationDiffusion-VLA: Scaling Robot Foundation Models via Unified Diffusion and AutoregressionDexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot ControlFine-Tuning Vision-Language-Action Models: Optimizing Speed and SuccessChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action ModelVLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion理想 VLA 相关论文GaussianAD: Gaussian-Centric End-to-End Autonomous DrivingGeneralizing Motion Planners with Mixture of Experts for Autonomous DrivingPreliminary Investigation into Data Scaling Laws for Imitation Learning-Based End-to-End Autonomous DrivingStreetCrafter: Street View Synthesis with Controllable Video Diffusion ModelsBalanced 3DGS: Gaussian-wise Parallelism Rendering with Fine-Grained TilingReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online RestorationDrivingSphere: Building a High-fidelity 4D World for Closed-loop SimulationDriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene RepresentationReport / 综述文章具身智能与自动驾驶的结合点VLA情报数据-佐思汽研小鹏汽车启动 VLA 基模研发2 亿 Clips 训练 720 亿超大规模模型小鹏汽车启动VLA基模研发2亿Clips训练720亿超大规模模型_搜狐汽车_搜狐网小米汽车端到端 VLA 自动驾驶方案 Orion似乎在 diss 理想的 MindVLAhttps://zhuanlan.zhihu.com/p/1890790479802638885理想全新一代智驾 VLA 技术方案解读https://zhuanlan.zhihu.com/p/18859883372250325572025 年自动驾驶即将开卷的端到端大模型 2.0 - VLA2025年自动驾驶即将开“卷”的端到端大模型 2.0 - VLA (Vision Language Action)_腾讯新闻π0 详解Physical Intelligenceπ0: 最强 VLA 开源模型理想贾鹏 GTC 2025 讲 VLA 完整视频带字幕https://www.bilibili.com/video/BV11yX5Y9EEj/