尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

杨立昆团队:用0.7%参数实现40%性能跃升,碾压7B级VLA!

杨立昆团队:用0.7%参数实现40%性能跃升,碾压7B级VLA! 「轻量化高精度视觉动作方案」目录01 Patch Policy完整模块化架构1.1 观测主干直接复用冻结ViT稠密Patch特征1.2 核心创新分块因果注意力掩码1.3 两类兼容策略头02 仿真真机双维度实验解读2.1 仿真环境定量结果Push-T/LIBERO/BlockPush/Cube2.2 三大真实精密操控任务核心落地验证2.3 空间压缩消融实验直观证明Patch必要性2.4 推理算力实测嵌入式落地关键2.5 零样本泛化补充测试03 总结纽约大学杨立昆团队联合Meta FAIR推出Patch Policy仅用OpenVLA-OFT约0.7%参数量在多套仿真与真机操控任务中综合成功率提升18%对比传统全局池化视觉策略性能涨幅达40%。该框架不用微调海量预训练视觉主干依靠分块因果注意力直接复用ViT稠密局部特征解决当下机器人视觉控制两大极端痛点全局单Token压缩丢失精细空间信息、千亿参数VLA推理延迟过高无法适配高频机械手实时控制给低成本嵌入式机械臂提供一套兼顾精度、速度、泛化能力的轻量化视觉动作流水线。01 Patch Policy完整模块化架构整套框架分为观测主干与策略头两大模块兼容VQ-BeT、Diffusion Policy两类主流动作解码器无需改动现有动作生成逻辑可即插即用替换原有全局视觉输入。图 | Patch Policy 完整架构示意图1.1 观测主干直接复用冻结ViT稠密Patch特征框架不微调预训练视觉编码器DINOv2、WebSSL、SigLIP等均可接入输入多视角图像后ViT输出完整P×D稠密Patch序列不做任何池化压缩。单段时序窗口内多帧图像拼接为T×P特征张量若任务附带目标图像/目标向量直接拼接嵌入维度完成条件编码。核心优势完全保留像素级局部空间特征插孔、笔杆、工具挂钩等精细几何信息全部留存是精密操控精度提升的底层基础。论文对比5类主流预训练视觉模型后证实WebSSL、DINOv2综合表现最优SigLIP因侧重图文对齐几何感知偏弱机器人任务效果垫底。1.2 核心创新分块因果注意力掩码常规时序Transformer为保证控制时序因果性会把每一帧所有Token视作独立时间步当前帧Patch无法互相交互单帧内空间关联信息完全丢失Patch Policy设计块因果掩码同一帧内部所有Patch双向自由注意力交互跨帧严格屏蔽未来时序信息。简单解释同一张图片里所有局部块可以互相参考物体轮廓、边缘细节不同时间步只能读取历史观测不泄露未来画面兼顾空间细粒度建模与时序控制约束。消融实验证明该掩码在Diffusion Policy上增益最明显单纯全局因果掩码会造成Cube任务指标大幅下滑。特征扁平化后叠加一维位置编码送入策略Transformer最后输出分块动作序列配合滚动时域控制逐帧执行动作。整套策略可冻结ViT仅训练少量策略头参数训练算力需求大幅下降。1.3 两类兼容策略头Patch Policy不绑定特定动作生成架构实验选用当下两种标杆策略验证通用性VQ-BeT量化隐空间行为Transformer分类回归混合损失推理延迟极低适合高速桌面抓取DINOv2搭配版本仅51.55M总参可实现10.99ms单轮推理Diffusion Policy去噪扩散动作生成多模态动作适配更强但迭代去噪带来固有延迟即便接入Patch特征单轮推理仍超400ms仅适合低实时性装配场景。02 仿真真机双维度实验解读评测分为四大仿真环境、三套Franka七自由度真机任务指标不单纯罗列成功率区分纸面仿真数值与真实机械臂落地价值同时标注指标局限性。图 | 仿真与真机评测环境总览图2.1 仿真环境定量结果Push-T/LIBERO/BlockPush/Cube图 | 多视觉表征仿真任务定量对比表全局池化CLS、平均池化基线在BlockPush、Cube多物体堆叠任务表现极差WebSSL Patch搭配Patch Policy后两项任务指标分别达到1.68、1.73相对传统方案提升近一倍同数据集下超越微调后的OpenVLA-OFT。指标局限仿真场景光线、物体纹理单一不存在反光、阴影、遮挡干扰仿真高分不能完全等同于真机表现仅能证明稠密Patch的基础增益。2.2 三大真实精密操控任务核心落地验证测试任务分别为2mm公差线缆插入、三支笔连续收纳、小型挂钩工具悬挂均属于工业小型装配典型工况每项实验重复20次统计分段成功率。图 | 三大真实机械臂操控任务执行样例图线缆插入最难任务OpenVLA完整插入成功率仅30%CLS全局基线60%Patch Policy达到70%多笔收纳第三支笔放置基线最高65%本文方案85%工具悬挂基线70%本文90%。核心原因插线、收纳需要精准识别微小目标位置全局特征丢失局部轮廓VLA受语言预训练偏移而Patch完整保留像素级空间细节。图 | 真机任务分段成功率统计表2.3 空间压缩消融实验直观证明Patch必要性图 | 特征压缩分辨率与Push-T任务性能对照表从256块逐步压缩至1块Patch任务指标持续下滑证明任何形式的空间下采样都会永久丢失操控所需几何信息视觉策略不能依靠压缩换取速度Patch Policy保留全部局部特征的设计具备明确必要性。2.4 推理算力实测嵌入式落地关键图 | 各模型参数量与单轮推理延迟Patch Policy-VQ-BeT仅10.99ms延迟满足100Hz高频机械臂控制标准OpenVLA-OFT 61.71ms仅能20Hz低速运行。硬件层面普通消费级RTX显卡即可完成训练无需多卡集群大幅降低机器人算法研发门槛。2.5 零样本泛化补充测试额外在CAP数据集完成未知物体抓取零样本测试Patch Policy抓取成功率87%传统全局CAP基线79%在从未见过的日常杂物上泛化能力更强稠密Patch提供通用物体局部几何先验不用针对新物体微调模型。图 | 真实Franka未知物体抓取成功轨迹图03 总结长久以来机器人视觉操控存在固有取舍要精细空间感知就得扛大模型算力开销要轻量化就得牺牲操控精度。Patch Policy用极简块因果注意力机制绕开全局压缩与千亿VLA两条极端路线直接复用互联网规模预训练ViT的稠密局部Patch特征在仅0.7%参数量前提下实现更优操控效果10ms级推理延迟适配各类低成本机械臂嵌入式设备。图 | 线缆插入、取笔、挂工具任务失败执行轨迹图该工作证明机器人精细操控不需要绑定图文对齐大模型仅靠纯视觉稠密空间表征就能解决绝大多数桌面装配、分拣任务给中小型机器人企业、实验室提供轻量化高精度视觉动作全新技术路线。后续可拓展方向为触觉多模态融合、原生高分辨率图像适配、轻量化Patch编码器压缩进一步拓宽工业落地场景。Ref参考论文Patch Policy: Efficient Embodied Control via Dense Visual Representations论文链接https://arxiv.org/pdf/2607.18236项目链接https://patch-policy.github.io/
返回列表