尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Science Robotics 8月封面 | 波士顿动力用同一套 RL 流水线,搞定人形、四足全身运动迁移

Science Robotics 8月封面 | 波士顿动力用同一套 RL 流水线,搞定人形、四足全身运动迁移 单阶段统一运动模仿 RL 框架仿真训练直接零样本部署真机 Atlas / Unitree G1 / Spot——跨机复刻复杂运动目录01 ZEST核心整套技术管线拆解异构运动素材统一重定向管线极简PPO强化学习训练核心设计跨形态零样本硬件部署02 实验结果三类机器人多动作跟踪指标ZEST vs 传统MPC模型控制仿真对标03 工程落地价值与后续研究方向落地应用场景未来拓展路线04 总结波士顿动力与RAI研究所联合推出ZEST框架仅单阶段强化学习训练无需接触标签、大量奖励手工设计仅凭动作捕捉、普通手机视频、动画三类原始数据就能零样本部署Atlas人形、宇树G1人形、Spot四足三类完全不同构型机器人。在全尺寸Atlas实现匍匐、霹雳舞等多接触全身动态动作同时完成视频直接驱动人形爬箱、四足连续后空翻等跨形态任务大幅降低机器人动态运动开发门槛。01 ZEST核心整套技术管线拆解整套框架分为三大完整链路多源运动预处理、自适应强化学习训练、硬件零样本部署全程无多阶段分步训练不依赖接触标注、长观测窗口、复杂手工奖励。▲ZEST完整框架流程图异构运动素材统一重定向管线ZEST支持三类完全不同的原始运动数据统一做运动学重定向适配机器人骨骼全程无需物理预优化修正动作捕捉MoCapVicon/Xsens采集高精度人体运动仅轻微平滑适配Atlas、G1人形生成慢跑、侧手翻、匍匐、霹雳舞等多接触动作普通手机视频ViCap依靠MegaSaMTRAM重建全局人体3D姿态即便存在足部滑移、姿态抖动等视频伪影模型也能自动过滤噪声实现跳舞、爬箱子、踢球等场景交互动作关键帧动画生成人类生理无法完成的动作Atlas背部连续旋转倒立、Spot连续后空翻、侧滚专门适配四足无人体参考的运动场景。重定向仅做骨骼对齐、尺度缩放、时间重采样保证弹道重力匹配不会强行修正视频里的不真实运动依靠训练阶段策略自适应降噪省去大量人工修正工作量。极简PPO强化学习训练核心设计训练采用非对称Actor-Critic架构。Actor仅搭载机器人机载可获取的本体感知IMU角速度、重力、关节位置速度、上一帧动作完全不使用全局位姿、外部感知保证部署时不需要状态估计器Critic额外拥有仿真内特权信息接触力、质心位置加速收敛硬件推理仅运行轻量化Actor前向网络。1残差动作输出机制策略不直接输出关节目标仅输出修正残差是参考运动关节位置残差叠加后送入关节PD控制器。相比直接预测完整关节角度残差输出大幅降低训练探索难度初始阶段不会出现巨大跟踪误差稳定性显著提升。PD增益依靠机器人并联执行器PLA解析模型计算论文提出三层递进近似模型平衡仿真速度与真实匹配度。▲并联驱动执行器 (PLA) 三层递进简化动力学模型示意图PLA是人形膝、踝核心传动结构精确闭环动力学仿真算力开销极大ZEST设计三层简化方案局部投影模型支撑连杆无质量、动态电枢对角近似、固定标称电枢模型。最终部署选用固定标称模型单次计算关节刚度仿真速度提升20%同时硬件PD控制器参数统一仿真、真机大幅缩小虚实差距。消融实验证明忽略PLA模型训练出的策略在爬箱、侧手翻动作真机全部失效。2自适应采样辅助力矩自动课程两大核心训练创新自适应分块采样所有长运动轨迹切分为固定时长片段用EMA指数移动平均记录每段跟踪失败率采样概率和失败率正相关同时保留最低采样权重避免遗忘简单动作。比如侧手翻、后空翻这类高难度片段会被高频采样慢跑、深蹲简单动作采样减少同等GPU时长下多接触高难度动作收敛速度提升一倍。▲仿真环境下的性能评估图中是训练中段自适应采样四大信号辅助力矩缩放系数、分段失败率、片段访问次数、采样概率难度越高的片段采样权重越大。模型基虚拟辅助力矩针对大幅度旋转、倒立、空翻这类极易训练中途失败动作在机器人基座施加虚拟辅助空间力矩力矩强度随分段失败率自动衰减跟踪精度达标后完全归零。相当于仿真内给机器人动态“辅助支撑”不用人工设计分阶段训练流程。消融实验显示移除辅助力矩后高难度动作训练时长翻倍20小时训练效果仅等于完整框架10小时水平。3轻量化统一奖励函数总奖励仅三部分全程无动作专属定制项完全不用针对匍匐、跳舞设计差异化权重跟踪奖励指数衰减误差损失柔和贴合参考运动不会因为微小偏差直接大幅降分正则奖励约束动作平滑、关节加速度、力矩/位置极限抑制畸形剧烈运动生存奖励每一步固定正向奖励减少训练中途提前终止。整套奖励不存在接触相关惩罚/激励机器人自主学习何时用手、膝、躯干接触地面不用人工标注任何接触时序。4域随机化仿真训练仿真训练加入随机外力冲击、摩擦系数浮动、机身质量扰动、观测高斯噪声训练策略适应建模偏差实现零样本直接部署真机无需硬件微调。单政策训练仅需单块NVIDIA L4 GPU耗时约10小时。跨形态零样本硬件部署训练完成策略导出ONNX格式自动化管线同步映射Atlas、G1、Spot三类机器人执行器参数同一套训练逻辑只替换机身动力学参数即可通用无需改动网络结构。▲ZEST 框架在多数据源、多机型机器人上的实体部署效果硬件部署仅依靠本体IMU与关节编码器无外部视觉、激光输入爬箱子等交互任务仅靠本体感知完成机器人与箱子初始xy偏移±10cm、航向±0.3rad范围内全部成功额外搭载2kg载荷、0.55~0.95m高度变化箱子仍能稳定攀爬。02 实验结果实验分为三类数据源验证、和MPC模型基线对标、仿真消融三部分。三类机器人多动作跟踪指标指标定义MAE(q)关节角度平均误差、MAD®机身姿态角平均误差、ML2(ω)机身角速度误差。▲分数据源各类运动任务硬件跟踪量化指标汇总表仅足部接触简单动作行走、踢球误差极低MAE(q普遍0.04~0.06rad运动流畅无冲击多接触复杂动作匍匐、霹雳舞、侧手翻误差小幅上升但真机仍稳定完成误差来源是仿真与真实摩擦、接触形变不匹配属于可接受虚实间隙Spot四足动画动作连续后空翻姿态误差明显增大甚至出现IMU饱和桶滚动作但策略会自主放宽参考轨迹贴合物理极限不会直接失控视频驱动G1爬箱初始位置偏移、载荷变化场景误差小幅上涨但五次重复测试全部稳定成功。ZEST vs 传统MPC模型控制仿真对标核心差距简单行走两类方案误差接近MPC依靠精准预设接触时序表现略优动态慢跑、侧手翻ZEST姿态、关节误差全面更低MPC因接触标注噪声出现跟踪漂移多接触动作倒立、四肢爬行、霹雳舞MPC直接执行失败表格标注“—”无法处理膝、躯干、手部复合接触这是模型控制路线无法逾越的短板。▲仿真环境下传统 MPC 控制器与 ZEST 多技能强化学习策略性能对比表MPC必须提前指定所有支撑末端超出手脚的身体接触场景完全失效而ZEST无接触约束天然适配全身多动态交互任务。03 工程落地价值与后续研究方向落地应用场景人形机器人研发快速开发舞蹈、体操、匍匐、搬运爬箱等全身交互动作省去动捕与控制器定制成本四足机器人杂技、巡检动作开发依靠动画生成无人类参考的空翻、滚转运动机器人初创企业轻量化开发管线无需专业模型控制团队仅依靠视频素材快速拓展动作库硬件迭代快速验证更换机身、增减载荷无需重新设计控制算法一套框架复用。未来拓展路线运动嵌入表征学习实现未知动作少样本/零样本适配摆脱预训练单动作策略接入视觉感知融合地形、障碍物信息实现非平整环境自主运动上层生成式规划对接文字、稀疏关键帧直接生成参考运动打通“指令-运动”全链路全自动机器人系统辨识流程降低仿真建模人工成本。04 总结ZEST解决了足式机器人动态全身控制长期存在的两大痛点多接触动作控制困难、运动开发与机型适配成本过高。通过单阶段无约束模仿强化学习、自适应训练机制、跨形态统一建模实现多源运动素材直接迁移至人形、四足实体机器人是目前通用性较强的全身动态模仿学习完整工程管线。但该框架现阶段仍属于“运动复刻”控制方案不具备自主环境感知与高层规划能力更适合作为机器人底层运动执行底座需要搭配上层感知、规划模块才能实现完整自主机器人系统。对于需要快速迭代动作库、多机型同步开发的机器人企业这套方案具备极高实用价值。Ref论文标题ZEST: Zero-shot embodied skill transfer for athletic robot control
返回列表