Transformer Transformer用于运动条件下机器人协同设计的统一模型该研究由 Huy Ha、Karen Liu、Shuran Song 开展有相关论文、视频和代码。研究涵盖研究动机、框架介绍、RoboTokens、架构设计、动力学自引导、实验结果、现实应用等方面。并非所有机器人都生来平等并非所有机器人都生来平等而 Transformer Transformer 作为统一模型能根据操作演示生成针对特定运动优化的完整机器人。例如为 ALOHA2 双手机器人平台设计的抛布机器人与原始设计相比将跟踪误差降低了 73%最大关节速度降低了 30%。这一成果基于 RoboTokens 训练的扩散 TransformerRoboTokens 是对机器人实体、状态和动作进行统一标记化的方法相同架构涵盖不同实体空间和用例。其动力学模型通过动力学自引导过程引导实体扩散三个设计空间的实验表明该模型能对未见过的奖励和轨迹进行零样本优化相比进化基线方法提高了性能并缩短了运行时间。技术总结视频有一个 17 分钟的详细介绍视频也可查看图文版本。给定操作任务哪种机器人最优机器人的实体形态决定其擅长的任务即便有出色策略糟糕的实体形态也会受限。具体问题是给定目标末端执行器的运动和奖励函数希望生成完整的机器人实体及控制器这被称为运动条件下的机器人协同设计。演示、生成、验证框架将机器人协同设计重新定义为三步过程演示期望的末端执行器运动模型生成优化后的实体同一模型验证该设计并控制机器人。同一个网络扮演生成器、评估器和跨实体控制器三个角色通过对机器人进行统一标记化联合训练实现。论文分为统一的机器人表示RoboTokens、统一的架构Transformer Transformer和统一的训练目标动力学自引导三部分。RoboTokens统一的机器人表示每个机器人变成类型化的标记序列蓝色标记编码实体橙色标记编码动力学。RoboTokens 是涵盖所有实体的共享词汇表有完整性、灵活性、一致性、可扩展性、可优化性等关键设计目标。对 MuJoCo Menagerie 中的 11 个机器人进行标记化每个机器人变成 28 - 101 个 RoboTokens 的序列且 RoboTokens 比 MJCF 文本紧凑 27 - 110 倍。Transformer Transformer统一的架构该模型是基于 RoboTokens 训练的扩散 Transformer采用 DDIM4 噪声调度。通过改变掩码标记同一个网络可扮演不同角色相同权重在动力学上进行联合训练。其标题有双关含义第一个“Transformer”指机器人第二个指自注意力架构。它有感知实体的控制器和多样化机器人类别的生成器两个功能前者能根据机器人调整控制策略后者能从高斯噪声中扩散出完整机器人。动力学自引导零样本处理奖励为解决为模型未见过的奖励函数生成高奖励机器人的问题可将模型预测输入用户奖励函数得到预测奖励并行多次运行模型选优。还可计算预测奖励梯度注入扩散过程即动力学自引导。以随机生成的四足机器人为例模型能根据不同奖励条件生成不同机器人实现零样本处理奖励。对于运动的分布扩散组合方法可实现为整个任务优化机器人在 UMI 双手机器人洗碗数据集上测试模型生成针对整个预留分布优化的机器人并验证设计。设计更优速度更快与随机和 CMA - ES 两个基线方法比较Transformer Transformer 在有更多推理种子时能生成更好设计性能约一分钟后达平台期。在三个设计空间和多个奖励函数下其零阶和动力学自引导变体生成奖励更高的设计速度比 CMA - ES 快几个数量级原因是对候选设计进行 GPU 并行化处理和非自回归扩散可并行评估整个过程。现实应用ALOHA 上的布抛掷任务为测试系统选择 ALOHA2 上的动态布料展开任务。原始 ALOHA 设计难以跟踪轨迹模型针对“跟踪速度”奖励优化 ALOHA 设计后制造出的优化设计有更长的连杆长度和倒置安装两个变化且优化后的设计关节轨迹更平滑。局限性与未来工作存在几何形状和场景、控制器迁移、测试时扩展的平台期、数据生成成本等方面的局限性扩展到复杂几何形状和场景上下文、提升控制器泛化能力、提高奖励预测准确性和探索替代推理方案、降低数据生成成本是未来研究方向。参考文献包括 Peebles, W., Xie, S.、Zhao, T. Z., Kumar, V., Levine, S., Finn, C. 等众多文献。完整参考文献列表可在论文中查看。