尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

主流VLA技术实现路线与动作序列关系(总结篇)

主流VLA技术实现路线与动作序列关系(总结篇) 你这个问题触及了机器人从语义到物理的全链路。我们一步步拆。一、6维目标位姿 → 关节动作序列的完整链路以机械臂夹爪抓取饮料瓶为例这条链路至少有4 个层级第①层任务指令语义空间 抓取饮料瓶 ↓ 第②层6维目标位姿任务空间 视觉定位给出 [X, Y, Z, RX, RY, RZ] 瓶子抓取点上方10cm夹爪垂直向下 ↓ 【逆运动学 IK】 第③层目标关节角关节空间 [J1, J2, J3, J4, J5, J6] 夹爪开合度 机械臂到达该位姿的关节角解 ↓ 【轨迹规划/插值】 第④层关节动作序列时间序列 [Action_0, Action_1, ..., Action_N] 每个 Action_i 是同一时刻的7维关节值 ↓ 底层控制器 → 电机扭矩 → 物理运动关键认知6维位姿→关节序列不是一步变换而是IK 求解 轨迹插值两步。第②→③步逆运动学IK已知末端目标位姿反求各关节角度。这一步有几个工程现实 多解性同一个6维位姿6轴机械臂通常存在最多8组解析解肩左/右、肘上/下、腕翻/不翻筛选准则过滤不符合关节限位的 → 在剩余解中选关节角度变化量最小的解总变化量 Σ|目标角度i - 当前角度i|奇异位形规避剔除接近奇异点的解求解方法几何解析法快、适合固定构型或数值迭代法如雅可比伪逆通用第③→④步轨迹规划/插值得到目标关节角后从当前关节角到目标关节角之间需要平滑过渡。最常用的是五次多项式插值# 五次多项式保证位置、速度、加速度都连续避免冲击q(t)a0a1*ta2*t²a3*t³a4*t⁴a5*t⁵# 6个约束起终点的位置、速度、加速度 → 解出6个系数抓取饮料瓶的典型动作序列阶段1移动到瓶子上方夹爪张开 Action_0 [J110°, J20°, J30°, J4-90°, J50°, J60°, G0°] Action_1 [J110°, J2-5°, J35°, J4-85°, J52°, J60°, G0°] ...插值过渡 阶段2向下接近 Action_k [J110°, J2-45°, J310°, J4-45°, J55°, J60°, G0°] ... 阶段3闭合夹爪抓取 Action_m [..., G0°→80°] # 夹爪逐渐闭合 阶段4抬起 Action_n [J110°, J2-30°, J315°, J4-60°, J58°, J60°, G80°] ...二、一组动作序列包含多少个关节动作由什么决定这个问题没有单一答案取决于你在哪一层看在传统运动规划里如 MoveIt序列长度 N 由以下公式决定 N 控制频率 × 轨迹时长具体受这些因素影响控制频率机械臂通常 100Hz~1000Hz如 π0 支持 50Hz 轨迹时长由起始关节角到目标关节角的距离决定受最大关节速度/加速度限制插值方法五次多项式插值时时长由边界条件起终点速度/加速度0和最大加速度共同决定平滑性约束为保证位置、速度、加速度连续至少需要一定时间跨度举例若控制频率 100Hz从当前位姿到抓取点需要 2 秒平滑运动则 N 100 × 2 200 个关节动作。在 VLA 模型里如 π0序列长度由action chunk动作块大小决定 模型Chunk 大小控制频率单次推理覆盖时长π050 步50Hz1 秒π0-FAST30-60 个密集 token-压缩比 10 倍StarVLA-OFT并行回归连续动作-取决于配置StarVLA-π流匹配去噪生成连续动作块-取决于配置π0 的执行策略 UR5e/Franka (20Hz)每 0.8 秒推理一次执行 16 步后重新规划其他机器人 (50Hz)每 0.5 秒推理一次执行 25 步后重新规划采用开环执行流匹配生成的动作块本身一致性高核心洞察π0 一次输出 50 步的动作块但不会傻等 1 秒执行完才重新感知——而是执行一部分如 16 步后就重新推理用新观测修正后续动作。这是开环动作块 闭环重规划的混合策略。决定序列长度的关键因素总结┌─────────────────────────────────────────┐ │ 1. 控制频率机器人硬件决定 │ │ 2. 轨迹时长由起止关节距离÷最大速度 │ │ 3. Action Chunk 大小VLA 模型超参 │ │ 4. 平滑性约束五次多项式插值的边界条件 │ │ 5. 重规划周期开环执行多少步后重新推理 │ └─────────────────────────────────────────┘三、π 系列、VLA 系列、StarVLA 各自覆盖哪一层这是你问题里最深刻的部分。我们把任务指令 → 动作序列链路标上层号再看每个项目覆盖到哪层第①层任务指令语义空间 抓取饮料瓶 ↓ 第②层6维目标位姿 [X, Y, Z, RX, RY, RZ] ↓ ← ← ← ← ← ← ← ← ← ← ← ← ← ← 第③层目标关节角 【IK 逆运动学】 [J1, J2, J3, J4, J5, J6, G] ↓ ← ← ← ← ← ← ← ← ← ← ← ← ← ← 第④层关节动作序列 【轨迹插值】 [Action_0, Action_1, ..., Action_N] ↓ 底层控制器π0 系列Physical Intelligence覆盖范围第①层 → 第④层端到端输入图像 语言指令 本体感受当前关节角输出连续动作块50步未来动作序列训练数据9.03 亿个专有机器人数据时间步 开源数据OXE、Bridge v2、DROID涵盖 7 种机器人配置动作表示连续动作空间18 维统一向量通过零填充适配不同机器人关键π0直接输出关节动作序列或末端位姿增量IK 和轨迹规划被吸收进了神经网络的映射能力训练目标流匹配损失学习从噪声到动作块的向量场 π0 的训练数据直接是图像语言关节动作序列三元组——它跳过了显式的 IK 和轨迹规划层让模型自己学出看到瓶子→输出抓取关节序列的端到端映射。VLA 系列OpenVLA、RT-2 等覆盖范围第①层 → 第④层端到端但动作离散化输入图像 语言指令输出离散化的动作 token如 OpenVLA 把每个关节角离散成 256 个 bin训练数据OpenX-Embodiment 等大规模机器人数据集动作表示离散 token 自回归生成局限离散化损失影响灵巧操作精度控制频率通常 10Hz 与 π0 的区别VLA 系列同样端到端输出动作序列但用离散 token 表示动作精度和频率低于 π0 的连续动作。StarVLA港科大开源框架覆盖范围框架层支持第①层 → 第④层的多种范式StarVLA 在统一接口下实现了4 种动作解码范式训练数据接口统一为图像语言动作可选本体感受动作头输出方式对应第④层动作表示StarVLA-FAST自回归离散 token离散化关节动作序列StarVLA-OFT轻量 MLP 并行回归连续关节动作序列StarVLA-π流匹配去噪连续动作块类似 π0StarVLA-GR00T双系统VLM 慢推理 DiT 快动作连续动作序列训练数据通过 LeRobotMixtureDataLoader 统一加载多源数据支持 LIBERO/RoboTwin/Calvin/RoboCasa/Behavior/Franka 等 数据格式为图像语言动作本体感受。 StarVLA 不是单个模型而是框架——它支持训练出覆盖第①层→第④层的各类 VLA 模型。你选哪个动作头就决定输出的是离散 token 还是连续动作块。三者的本质区别π0端到端连续动作块流匹配 → 训练数据图像语言关节动作序列 → 输出50步连续动作块 50Hz VLAOpenVLA端到端离散动作 token自回归 → 训练数据图像语言离散化动作 → 输出离散 token 序列 StarVLA框架4 种动作头任选 → 训练数据统一的图像语言动作本体感受 → 输出取决于所选动作头离散/连续/流匹配/双系统四、回到你的核心问题6维位姿在这一切中的位置关键澄清在经典机器人 pipeline 里6维位姿是第②层IK轨迹规划在第②③和③④层之间。但在现代 VLA如 π0里6维位姿不是显式的中间表示VLA 直接从像素语言映射到关节动作序列IK 和轨迹规划被**端到端学习吸收**进了神经网络两种工程范式对比范式 A模块化 pipeline传统视觉定位 → 6维位姿 → IK → 目标关节角 → 轨迹插值 → 动作序列每层可独立调试需要精确的相机标定和机器人模型适合结构化环境范式 B端到端 VLA现代图像 语言 → VLA → 关节动作序列直接输出跳过显式 IK 和 6维位姿表示训练数据是图像语言关节动作序列三元组适合非结构化、需要泛化的场景6维位姿在这一范式里不作为中间表示存在范式 C混合当前趋势图像 语言 → VLA → 6维目标位姿 → IK → 目标关节角 → 轨迹插值 → 动作序列VLA 只负责末端要去哪IK 和轨迹规划用成熟库MoveIt! TRAC-IK兼顾语义理解和执行可靠性6维位姿作为 VLA 的输出接口五、给你的实操建议如果你的目标是训练一个 VLA 抓取饮料瓶采集数据用 ALOHA 或示教器采集图像语言指令关节动作序列三元组50-500 条演示选框架用 StarVLA OFT 动作头最简单稳定或 StarVLA-π更复杂但更精细训练端到端训练让模型自己学习看到瓶子→输出关节序列6维位姿的角色仅作为数据预处理时的中间表示用于数据增广或校验不作为模型输入/输出如果你用传统 pipeline视觉系统输出 6维位姿MoveIt! 做 IK 轨迹规划输出关节动作序列这里不需要 VLA——用规则/脚本即可一句话总结一组关节动作序列的长度在传统 pipeline 里由控制频率 × 轨迹时长决定在 VLA 里由action chunk 大小决定π0 是 50 步 50Hz。π0 系列和 VLA 系列都端到端覆盖任务指令→关节动作序列全链路训练数据直接是图像语言关节动作三元组IK 和轨迹规划被神经网络吸收StarVLA 作为框架通过 4 种可插拔动作头支持这种端到端训练数据接口统一为图像语言动作本体感受。6维位姿在端到端 VLA 里不作为显式中间表示——它是传统模块化 pipeline 的产物在现代 VLA 训练中被吸收进了从像素到关节的端到端映射中。其他补充范式A跟现代VLA没有直接关系——它是传统的模块化机器人控制链路不包含VLM/VLA参与决策。但范式B和范式C在现代VLA里都有对应而且界限比想象中更模糊。范式A传统模块化pipeline与VLA无关视觉定位 → 6维位姿 → IK → 目标关节角 → 轨迹插值 → 关节序列决策模块规则/脚本/传统视觉算法如AprilTag、点云配准无VLM参与不理解语言指令不做语义推理典型应用工业流水线上看到marker→抓取的固定任务与VLA的关系❌ 无关。这是VLA出现之前的经典方案 但有个灰色地带如果把VLA当作视觉定位模块嵌入范式A——即VLA只输出6维位姿后面接传统IK——这就变成了范式C。所以严格说范式A“VLA替换视觉定位” 范式C。范式B端到端VLA图像语言 → 关节动作序列核心特征VLA直接输出关节动作序列IK和轨迹规划被神经网络吸收。对应我们之前讨论过的这些算法① OpenVLA系列离散token自回归输出256-bin离散化的关节动作序列自回归一个个token生成训练数据图像语言关节动作序列OpenX-Embodiment典型案例OpenVLA、RT-2、RT-1特点离散化损失影响精度控制频率10Hz② π0系列流匹配连续动作输出50步连续动作块 50HzUR5e/Franka上16步后重规划训练数据9.03亿机器人时间步OXE/Bridge/DROID直接是关节动作序列典型案例π0、π0-FAST30-60个密集token特点连续动作空间精度高频率高③ StarVLA-OFT / StarVLA-πStarVLA-OFT轻量MLP并行回归 →连续关节动作序列StarVLA-π流匹配去噪 →连续动作块类似π0训练数据统一的图像语言动作本体感受格式④ ACTAction Chunking Transformer输出动作块chunk连续关节序列训练数据ALOHA示教数据关节动作序列虽不是严格意义的VLA早期ACT不带VLM但是VLA时代动作块概念的奠基者范式B的共同特征训练数据格式 (图像, 语言) → 关节动作序列 推理输出 关节动作序列直接下发给底层控制器 IK和轨迹规划 被吸收进神经网络范式CVLA输出6维位姿 外部IK/规划核心特征VLA只输出末端执行器6维目标位姿IK和轨迹规划由传统库MoveIt! TRAC-IK完成。对应这些算法/实践① 3D Diffuser Actor输出末端位姿的扩散分布6维位姿后续外部IK把6维位姿转成关节角定位VLA负责末端去哪传统模块负责关节怎么动② SpatialVLA输出空间增强的3D位姿预测强调3D空间理解输出更适合直接作为6维位姿后续外接IK③ RoboPoint系列输出3D点/6维位姿明确设计为VLA as 视觉定位器后续传统控制模块接管④ 部分OpenVLA的工程变种实际部署时有工程师把OpenVLA的离散动作输出解释为6维位姿的离散化然后外接IK这不是原版OpenVLA的设计意图但是工程上的常见折中⑤ StarVLA框架下的潜在组合StarVLA是框架不是单一模型理论上可以用StarVLA训练一个输出6维位姿的VLA把动作头改为位姿回归头然后外接MoveIt!做IK和轨迹规划范式C的共同特征训练数据格式 (图像, 语言) → 6维目标位姿 推理输出 6维位姿 后续处理 IK 轨迹规划 → 关节动作序列三者的本质区别与对应关系┌─────────────────────────────────────────────────────────┐ │ │ │ 范式A传统模块化无VLA │ │ 视觉 → 6维位姿 → IK → 关节序列 │ │ ✗ 与VLA无关 │ │ │ │ ─────────────────────────────────────────────────── │ │ │ │ 范式B端到端VLA │ │ 图像语言 → VLA → 关节动作序列 │ │ ✓ OpenVLA离散token │ │ ✓ π0 / π0-FAST流匹配连续 │ │ ✓ StarVLA-OFT / StarVLA-π │ │ ✓ ACT动作块奠基 │ │ │ │ ─────────────────────────────────────────────────── │ │ │ │ 范式CVLA 传统控制 │ │ 图像语言 → VLA → 6维位姿 → IK → 关节序列 │ │ ✓ 3D Diffuser Actor │ │ ✓ SpatialVLA │ │ ✓ RoboPoint │ │ ✓ OpenVLA的工程变种 │ │ ✓ StarVLA理论可训练位姿回归头 │ │ │ └─────────────────────────────────────────────────────────┘一个关键澄清范式B和C的区别在于训练监督信号落在哪一层维度范式B端到端范式C混合训练标签关节动作序列6维目标位姿IK的角色被神经网络吸收显式存在传统库轨迹规划被神经网络吸收显式存在五次多项式等训练数据需求需要大量关节空间示教只需6维位姿标注更容易获取泛化性强学到关节级映射中等IK求解可能失败执行可靠性依赖VLA输出质量高IK保证运动学可行代表算法OpenVLA, π0, StarVLA-OFT/π3D Diffuser Actor, SpatialVLA为什么会有这两种范式并存范式B端到端的优势数据效率直接从像素到关节减少中间表示的信息损失泛化学会看到瓶子→关节动作的直觉映射适应非标能处理IK难以建模的场景柔顺控制、接触-rich任务范式B的劣势需要大量关节空间示教数据昂贵训练不稳定动作空间维度高黑盒难以调试为什么输出这个关节角范式C混合的优势数据获取容易只需6维位姿标注可用人类示范/合成数据执行可靠IK保证运动学可行避开奇异点模块化VLA出错时IK仍可工作范式C的劣势6维位姿→关节角的IK可能无解目标不可达信息瓶颈VLA被迫用6维表示所有意图丢了细节两段式误差累积当前趋势范式B是主流但范式C在特定场景有价值范式B占据主流π0、OpenVLA、StarVLA-OFT/π 都是范式B学术 benchmarksLIBERO、RoboTwin、CALVIN上的SOTA全是范式B原因是benchmark任务足够复杂范式C的6维位姿瓶颈限制了性能范式C的适用场景工业抓取目标明确6维位姿足以描述意图数据稀缺只能用人类示范标注6维位姿没有关节示教安全关键需要IK保证运动学可行不能有关节角越界跨 embodiment同一个VLA输出的6维位姿可以被不同构型的机器人各自IK执行回到StarVLA的具体定位StarVLA作为框架理论上是范式中立的用OFT动作头→ 范式B输出连续关节序列用π动作头→ 范式B输出连续动作块用FAST动作头→ 范式B输出离散关节token用自定义的位姿回归头→ 范式C输出6维位姿但目前StarVLA开源的4种动作头OFT/π/FAST/GR00T都是范式B——输出关节动作序列。范式C在StarVLA里需要自己扩展动作头。一句话总结范式A与VLA无关传统模块化范式B对应OpenVLA、π0、π0-FAST、StarVLA-OFT/π、ACT——端到端输出关节动作序列范式C对应3D Diffuser Actor、SpatialVLA、RoboPoint——VLA输出6维位姿后外接IK。两者的本质区别在于训练监督信号落在哪一层范式B直接监督关节动作序列范式C只监督6维目标位姿。当前学术主流是范式B性能上限更高范式C在工业抓取、数据稀缺、安全关键场景仍有价值。如果你的目标是在LIBERO/RoboTwin等仿真benchmark上刷指标→ 选范式BStarVLA-OFT或π。如果你的目标是工业落地需要可靠的运动学保障→ 选范式CVLA输出6维位姿MoveIt! IK。
返回列表