尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

具身模型消融实验总结分析

具身模型消融实验总结分析 需要先说清楚一件事这些消融都是在各自基准和数据上做的结论有适用范围不能当成跨场景的铁律——这也是为什么不同论文在某些点上会打架。一、TRI × 清华《Co-training Large Behavior Models》消融规模5 大类 co-training 数据 → 8 种子模态 × 3 种训练策略 1 个 baseline共89 个策略、5.8 万次仿真、2835 次真机评估用 Welch’s t-test / STEP test Bonferroni 校正核心消融结论消融维度结论标准 VL 数据最优模态之一两阶段全协同训练最优阶段1预训练阶段2联合精调机器人轨迹语言标注有效VLM 标注 脚本标注两阶段仅阶段1最优跨具身机器人数据OXE最优模态之一对分布偏移/未见任务提升最大两阶段仅阶段1最优人类视频 VLM 标注有效两阶段全协同最优人类视频潜在动作仅在低目标机器人数据量下有用大数据量下无收益甚至有害离散动作 tokenFAST / VQ-VAE无统计显著收益FAST 甚至降低未见任务泛化CoT 显式约束短程操作任务中无提升甚至退化“画蛇添足”纯机器人数据训练侵蚀 VLM 骨干的通用 VLM 能力有效协同训练能保留/恢复 这篇是目前数据模态消融最系统的一篇相当于 VLA co-training 的避坑圣经。二、VLANeXtICML 2026—— 500 实验提炼 12 条配方消融规模在统一框架下围绕 RT-2 基线从基础组件 / 感知要素 / 动作建模范式三个维度做超过 500 组受控实验LIBERO LIBERO-plus 上逐步叠加设计选择核心消融结论按设计维度设计维度消融发现Policy 模块独立 policy head30.2%≫ baseline19.8%大模型Large Policy Module达 64.4%是最大单一增益Action Chunkingchunk4 最优75.4%chunk8 略降74.6%训练目标回归85.4% Flow Matching80.0%≈ DDIM80.0% VQ-VAE 分类58.8% bin 分类74.6%VLM 骨干容量Qwen3-VL-4B95.8% Qwen3-VL-2B90.0% LLaMA3.2SigLip80.0% PaliGemma69.8%VLM-Policy 连接Soft Connection可学习 query buffer91.8%略优于 Loose / Tight时间观测历史加入多帧历史反而降到 85.0%当前帧 91.8%多帧历史引入噪声相机视角第三人称手腕多视角 97.6% ≫ 单第三人称 91.8%本体感受注入位置注入 VLM 端 98.0%最优 注入 Policy 端 96.2% 两端都注 97.6% 不注入 97.6%本体感受投影Linear Projector 98.0% ≈ Transformer Projector MAE 97.0%世界模型视角加 world modelling 辅助 98.0% → 94.4%LIBERO-plus频域辅助损失加 frequency domain loss 后 LIBERO-plus 从 87.2% 提升到94.4%⚠️ 注意VLANeXt 发现模型性能随骨干增强而提升这与 LLaVA-VLA 的参数规模≠性能结论相反——VLANeXt 的解释是自己用了更大的 policy module能消化更强 VLM 的表征三、LLaVA-VLA CEBench —— 8 条轻量化设计结论消融规模在 CEBenchCALVIN RoboTwin 真机移动操作上系统消融得出8 条关键结论编号消融维度结论F1参数规模性能与参数规模非严格正相关0.5B 无预训练可媲美 7BF2多视角融合多视角是 3D 感知核心单图拼接vertical stack优于分开编码F3本体感受编码Token 化 MLP 投影更好利用 VLM 的语言建模能力F4动作分块分块增强规划能力chunk5 最优F5跨具身预训练非必需域内多任务后训练 单任务微调即够F6扩散头 vs 离散扩散头非必需离散 token 分块可达媲美性能CALVIN: 离散 94.8/84.5/71.3 vs 连续 93.5/84.4/73.5F7离散化粒度粗粒度优于细粒度256 bins 在效率和泛化上优于 1024 binsF8统一动作空间Direction Token Value Token是移动操作系统最优解真实移动操作 4/10 vs 2/10四、OpenVLAStanford/CMU/Berkeley/DM消融规模CoRL 2024真机 BridgeData V2 LIBERO 仿真消融维度结论OpenX 预训练混合移除后 Bridge 任务从 76.3% 降到45.6%↓30.7 点是多机体多样化数据的主收益双视觉编码器SigLIPDINOv2去掉 DINOv2 降到 40.6%↓5 点空间细节有用但边际小于数据多样性视觉编码器冻结 vs 微调冻结显著更差早期 Bridge 实验 80.0% vs 46.7%VLA 不能照搬 VLM 的冻结视觉经验输入分辨率224px 与 384px 性能无明显增益但 384px 训练慢 3 倍LoRA 微调rank32 的 LoRA 可达全参数微调约 4% 参数差距内的性能4-bit 量化内存减 50%性能无损8-bit 量化性能下降主要来自推理速度而非精度训练节奏固定 lr2e-5、无 warmup、约 27 epoch 直到 action token acc 95% OpenVLA 最有工程价值的两条OpenX 混合几乎不可省VLA 必须微调视觉编码器。五、OctoBerkeley RAIL消融规模25 个数据集组合 6 个新任务微调评估消融维度结论架构Transformer-firstViT 类83%在大规模多样数据上优于 ResNet小 Transformer 70%但在小数据集上 ResNet 反超 ViT训练数据多样性RT-X 数据集混合 60% ≫ 单一 Bridge 43% ≫ Octo-Small baseline 83%数据多样性至关重要训练目标扩散头 83%≫ 连续动作 MSE 35% ≫ 离散化动作 18%模型规模Octo-Base Octo-Small更大模型在场景感知和鲁棒性上更优指令模态目标图像指令比语言指令成功率高 25%微调效率约 100 条演示 单卡 5 小时平均成功率 72%从零训练仅 20%VC-1 仅 15%六、SmolVLAHugging Face LeRobot消融规模LIBERO 上全套消融消融维度结论注意力结构CASA 交替 85.5% 仅 CA 79.0% 仅 SA 74.5%因果掩码因果掩码 74.5% 双向注意力 67.5%防止动作偷看未来长时序任务从 23% 涨到 40%VLM 层截断用前 16 层 78.5%仅比 32 层全量 80.3% 低 1.8 点速度翻倍性价比极高隔层采样优于小 VLM 但仍不如截前 N 层训练目标Flow Matching 85.5% L1 回归 75.25%动作分块大小10-50 个动作的块大小在响应性和计算效率间取得平衡异步推理异步 73.3% vs 同步 78.3%单任务耗时 13.75s → 9.7s提速 30%60s 内完成循环数 9→19七、LingBot-VLA 2.0蚂蚁灵波消融规模4 个 GM-100 真机任务聚焦动作表示与训练策略消融维度结论动作目标相对关节动作 55.0% ≫ 绝对关节动作 33.7%相对动作把目标分布标准差从约 0.80 降到 0.28动作归一化MeanStd 归一化最优保住大幅修正动作|x|1.5 长尾不裁剪损失函数L2 优于 L146.4% → 55.0%relQpos 目标多在零附近L2 更贴合高密度区L1 仅在接触丰富/重尾的挤番茄酱任务上更好分布对齐提出分布对齐 gap指标解释 relQpos 收益条码扫描任务关节动作 gap 远小于末端关节动作成绩碾压58.7 vs 24.0 LingBot 的消融价值把 VLA 里常被默认的相对动作 MeanStd L2组合给出了量化的、可复现的理由。八、跨论文结论冲突与共识把上面七份消融放一起看有些点是共识有些是冲突✅ 强共识数据多样性 架构微调OpenVLA、Octo、TRI 三篇一致扩散 / Flow Matching 训练目标优于 MSE / 离散分类Octo、TRI、VLANeXt、SmolVLA、LLaVA-VLA 一致VLA 必须微调视觉编码器OpenVLA 明确VLANeXt 通过线性投影器隐含Action chunking 有益VLANeXt chunk4/8、LLaVA-VLA chunk5、SmolVLA 10-50本体感受信号要显式注入VLANeXt 注入 VLM 端最优、LLaVA-VLA token 化优于 MLP、LingBot 相对关节动作最优⚖️ 冲突点取决于实验设置冲突点立场 A立场 B参数规模VLANeXt更大 VLM 骨干更好Qwen3-VL-4B 95.8%LLaVA-VLA0.5B 无预训练可媲美 7B解释VLANeXt 用了更大的 policy module 消化表征LLaVA-VLA 认为轻量 head 限制了大模型收益离散动作 tokenTRIFAST/VQ-VAE 无显著收益LLaVA-VLA配合 chunking 的粗粒度离散化可达媲美性能时间观测历史VLANeXt多帧历史反而引入噪声多数 VLA观测历史有益但 VLANeXt 用当前帧强 chunking 补偿了⚠️ 单篇消融的局限性SmolVLA消融主要在自己加的小模块上没有换同尺度其他 VLM 做 backbone 对照——所以小模型媲美大模型的结论有内部有效性限制LingBot-VLA 2.0消融聚焦动作表示 4 个选择没有做数据规模 / 视觉骨干的消融TRI Co-training结论是 4000 小时数据规模下的低数据场景下单目 / 离散 token 可能仍有用论文自己也承认潜在动作在低数据量下有效给新手的消融结论查阅地图如果你的疑问是“XX 设计选择该不该用”按下面这个映射去查对应论文的消融表数据怎么混合 →TRI Co-training整个 VLA 架构怎么搭 →VLANeXt 12 条配方小模型能不能打 →LLaVA-VLA 8 条结论7B 级 VLA 工程化 →OpenVLA 消融表通用机器人策略预训练 →Octo 表 II高效 VLA消费级 GPU→SmolVLA LIBERO 消融动作表示 / 归一化 / 损失 →LingBot-VLA 2.0 §6
返回列表