尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

WAM 输出动作如何在真机连续执行?Motubrain 用 6 种 RTC 策略做了一次完整真机验证

WAM 输出动作如何在真机连续执行?Motubrain 用 6 种 RTC 策略做了一次完整真机验证 不是模型不够快而是系统没跟上。——“实时”远不止模型推理快慢这么简单目录01 WAM的实时困境推理延迟从何而来02 实时执行不是单点优化需要解决三个层次问题03 异步推理下新旧 Chunks 如何衔接同步执行 sync纯异步切换 async直接动作加权 asyncblend 与 simple推理期速度场引导 infer04 六种策略在三类任务上的实证离线轨迹分析时序对齐是前提在线真机实验三类任务六种策略05 连续性约束的代价与开放世界的缺口World Action ModelsWAMs具备强大的具身泛化能力但端到端推理延迟较长可达秒级。从相机捕获图像、网络传输、联合视频-动作序列上的迭代去噪到最终指令下发每一步都会增加延迟。这种高延迟带来的影响主要有两方面而且很难单纯依靠增加算力彻底解决第一卡顿。传统的同步执行策略要求机器人执行完当前动作段后停下来等待下一轮推理完成。第二实时响应能力下降。在长达秒级的推理窗口期内机器人无法根据新的环境变化及时调整动作。它很难持续追踪传送带上的移动物体也无法及时应对突然出现的障碍。正是在这样的背景下RTCReal-Time Chunking面向 Action Chunking 策略的实时执行机制开始受到关注。它要回答的核心问题是当推理延迟不可避免时如何让机器人既能实时响应环境变化又能保持动作的流畅与精准01 WAM的实时困境推理延迟从何而来要理解 RTC 的必要性首先需要看清 WAM 的推理链路到底有多长。World Action Models 基于扩散模型或流匹配Flow Matching构建其核心特征是联合推理感知与动作通过迭代去噪的方式一次性预测未来固定长度的动作序列具备较强的多任务泛化能力与精细操作水平。但这种处理方式也带来了较高的推理延迟在 Motubrain 团队的实验设定中WAM 的预测长度为 H 24 帧在 10Hz 控制频率下对应 2.4 秒的动作序列端到端延迟中位数 d_est 8 帧约 0.8 秒。这意味着即便推理已经完成机器人还需要继续执行 0.8 秒的“盲飞”动作才能用上新的观测信息。面对这一问题行业中的一个基本思路是异步推理不等当前动作段执行完毕就提前基于最新观测发起下一轮推理让计算与执行并行。▲图1 | 同步与异步执行的时序对比。同步模式上必须等模型推理完成后才下发下一段动作出现等待空档异步模式下让当前动作执行与下一轮推理并行。黄色区域为系统必须处理的端到端延迟蓝色区域为新旧 chunks 剩余的重叠区域绿色区域为非重叠区域。但异步推理只是把问题从“等待”转换成了“衔接”新旧两段动作基于不同时刻的观测生成在重叠区域必然存在分歧。如果直接在交接点进行硬切换async分歧会导致机械臂末端位置的瞬间跳变产生巨大的加加速度jerk甚至损坏硬件但如果为了追求平滑而强行抹平这些分歧又可能掩盖模型对精细位置的微调导致插拔、抓取等高精度任务失败。如何在异步切换中兼顾流畅性与准确性成为 WAM 实时部署中一个关键问题。02 实时执行不是单点优化需要解决三个层次问题将 RTC 从概念落地为可运行的工程方案至少需要解决三个层次的问题第一层计算与执行的并行调度机器人不能执行完一段动作后再等待模型生成下一段动作。需要通过异步调度在当前动作段执行到第 s 帧时s H就提前发起下一轮推理从而尽可能覆盖推理耗时。这是 RTC 的基础——没有并行调度后面的衔接和融合都无从谈起。第二层观测与动作的精准时序对齐模型生成的新动作段是基于过去某个特定时刻的观测。模型在时刻 t 接收到观测经过 d 帧的延迟后生成动作序列在部署时控制器必须通过硬件时间戳将每一帧动作命令与对应的观测时刻精确关联进而在时间轴上对齐不同时刻观测生成的动作序列以便进行异步切换。准确的时序对齐而非精确的延迟估计是所有跨 chunks 融合方法能够正常工作的前提缺少对齐跨 chunks 的动作在物理上不一致任何融合方法都很难取得理想效果。第三层新旧 Chunks 的连续衔接这是 RTC 最关键的算法问题。异步推理下新旧动作序列基于不同观测生成在重叠区域overlap必然存在偏差。硬切换会产生位置跳变和极高的 jerk但过度平滑又可能损害精细操作所需的准确性。因此RTC 真正要解决的不只是“消除卡顿”而是如何在保证实时响应的前提下同时维持动作的连续性与执行精度。03 异步推理下新旧 Chunks 如何衔接针对异步推理下新旧 chunks 的衔接问题Motubrain 团队在其最新研究《World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment》中对现有策略进行了系统梳理。根据融合机制和发生阶段的不同这些方法可以归纳为以下六种策略▲图2 | 各策略在干预时机和约束强度上存在根本差异。同步执行 sync同步执行是当前最常见的部署方式机器人执行完推理得到的完整 action chunk 后停下来等待下一次推理完成然后硬切换到新 chunk。这会导致每个 chunk 边界处都有一个长度为 d 帧在 Motubrain 团队的实验中约 0.8 秒的停顿。由于没有融合动作精度不会受到额外影响但在动态任务中的局限非常明显。原因在于同步执行在推理期间无法更新观测因此很难应对持续移动的目标。纯异步切换 async这是最原始的异步策略推理在 chunk n 执行到第 s 帧时提前触发新 chunk 到达后在预估延迟 d 处硬切换。不进行任何融合。async 消除了同步模式下的等待停顿但没有处理新旧动作之间的衔接问题硬切换带来的 jerk 在所有策略中是最高的严重时甚至无法完成基本的抓取任务。在 Motubrain 的实验中async 在传送带取物任务中的完成得分与 sync 同为 20 分——虽然响应了但动作剧烈抖动导致抓取失败。async提供了异步执行的基础后续在其上叠加的融合策略本质上都是在解决同一个问题如何处理两段动作在重叠区域的分歧。直接动作加权 asyncblend 与 simple这类方法在动作输出层面进行操作不修改模型训练或推理过程又可细分为两种asyncblend在推理完成后、指令下发前对新旧两段动作的重叠区域进行加权融合。权重 w(t) 在延迟区域为 1完全信任已执行的旧动作向末端逐渐衰减到 0完全切换到新动作。这一思路与 SmolVLA 中的 chunk fusion 机制一致。▲图3 | SmolVLA 的异步执行原理。系统在当前动作队列尚未耗尽时就开始计算下一段动作并对重叠部分进行聚合以缩短控制更新间隔。asyncblend 是做好了时序对齐之后、最低可用的有效基线——不需要修改模型不需要重新训练仅靠简单的加权平均就能显著降低 jerk提高任务完成度。在 Motubrain 的实验中asyncblend 将传送带取物得分从 async 的 20 分提升到 40 分验证了“对齐 融合”这一组合的有效性。simple即 SimpleRTC则更进一步。在去噪过程的每一步将旧 chunk 的动作作为约束融入新 chunk 的预测中。因为干预发生在去噪过程中而非输出后其平滑效果更强——在动态任务和长时序任务中simple 的 jerk 值在所有策略中最低。但与此同时simple 也带来了精度与平滑之间的 trade-off。在精细操作任务Block Into Slot中simple 的得分仅为 27.5 分满分 100远低于 sync 的 72.5 分和 train 的 70 分。原因在于混合后的动作是两个预测结果之间的“折中”。在需要精确接触的任务中这种折中可能影响模型对目标位置的精细调整。推理期速度场引导 inferinferInference-Time RTC是一条在理论上更能走通的路线它不直接修改输出动作而是修改去噪过程中的速度场velocity field。在每一步去噪时将速度方向向旧 chunk 的延迟区域“拉近”引导新动作的生成轨迹向旧动作靠拢。▲图4 | 推理期 RTC 的动作修正机制。新动作的前几步被引导向已承诺执行的历史轨迹后续重叠区域的引导强度逐渐减弱。这种方案只调整去噪方向不覆盖输出动作理论上可以保留模型原生的生成自由度。但对于 WAMs 而言仅施加方向层面的软约束并不能稳定限制最终输出动作。在 Motubrain 团队的离线分析中在延迟区域前 8 帧infer 的平均绝对误差MAE和最大误差均显著高于 simple 和 train。这表明速度场引导对输出动作的约束仍然不够稳定新旧 chunks 在切换处仍可能出现较大跳变。在真实硬件上这种位置突变会对精细操作和硬件安全带来风险。此外infer 的推理开销更大实际有效延迟 d 比其他方法更长进一步压缩了可用重叠区域削弱了异步调度的优势。训练期前缀条件注入 traintrainTraining-Time RTC将“衔接前序动作”这一要求前置到了训练阶段。具体做法是在训练时将旧 chunk 已执行的前 d_est 帧即延迟区域作为干净、无噪声的条件信号注入模型。权重采用阶跃函数延迟区域内为 1强约束之后为 0释放剩余部分让模型自由预测。这样一来模型在训练中就会学习“给定一段已经确定的动作前缀如何继续生成后续轨迹”。▲图5 | 训练期 RTC 的条件化注入。模型在训练阶段接收确定、无噪声的历史动作前缀灰色方块其余动作仍待去噪从而学会从已执行的动作自然延续。训练期注入有几个关键优势推理时零额外开销前缀条件是一次训练投入部署时不需要任何额外的融合计算或去噪干预轨迹衔接更自然模型从底层学会了自然衔接不需要推理阶段的加权约束来强行压制分歧精度与平滑兼得与 simple 不同train 仅在延迟区域施加硬约束剩余 overlap 区域不做干预保留了模型对新观测的调整能力。04 六种策略在三类任务上的实证上述策略在理论上各有差异但到了真实物理硬件上——尤其是 WAM 这类高延迟模型不同路线的实际表现如何为此Motubrain 团队在 10Hz 的双臂机器人平台上对全部六种策略sync、async、asyncblend、simple、infer、train进行了系统的离线轨迹分析和在线真机实验。离线轨迹分析时序对齐是前提在上真机之前团队首先进行了离线开环评估从训练数据中采样间隔 s 帧的两个观测分别送入模型得到两个 chunks模拟连续两次异步推理调用然后计算重叠区域的位置误差。▲图6 | 各策略在重叠区域的平均绝对误差MAE。黄色区域为延迟区域前 8 帧绿色区域为剩余 overlap9-20 帧。误差越低说明方法对动作的约束能力越强。▲图7 | 各策略在重叠区域的最大绝对误差。一次显著的位置突变即可能导致精细操作失败。图中可见 infer 在延迟区域内无法稳定约束极端跳变。离线分析主要得到几个结果第一infer 在延迟区域的约束失效。速度场引导是一种软约束只改变去噪方向而不直接约束输出动作。在所有四个分量上infer 在延迟区域的 MAE 和最大误差均明显高于 simple 和 train因此 chunk 边界仍可能出现位置跳变。第二延迟区域的约束与剩余 overlap 的误差累积。simple 和 train 都能将延迟区域内的误差压到接近零。进入剩余 overlap 后两种策略的误差都随预测步数逐渐累积simple 在去噪过程中的逐步融入仍无法完全消除相邻 chunks 在长时预测上的分歧train 仅约束前缀、释放后续预测误差增长幅度更大。这一对比也说明延迟区域和剩余 overlap 是两个性质截然不同的区段前者可以通过强约束压制后者则取决于模型本身的预测一致性。在线真机实验三类任务六种策略团队选取了三个具有代表性的场景▲图8 | 六种策略在三种真实机器人任务上的在线评估结果。三个维度分别为完成得分越高越好、完成时间越低越好和平均 jerk越低越平滑。动态任务抓取传送带移动物体sync 的结构性缺陷面对移动目标传统同步执行sync因为在推理窗口期内无法更新观测状态得分仅为 20。完成时序对齐后即便只是采用最基础的输出层融合asyncblend得分也提升到了 40说明简单异步融合已经可以带来明显改善。simple 得到 80 分。由于该任务对精细位置的要求相对较低更强的平滑约束在这里带来了较好的效果。train 以 96 分取得最高得分同时兼顾了响应速度与动作平滑度。这与训练期注入有关模型在训练阶段就已经适应了带有历史动作前缀的预测方式。精细操作任务积木插入插槽simple 的平滑-精度 trade-off 更明显在这一任务中平滑和精度之间的矛盾更加突出。去噪期融合策略simple虽然能够让轨迹更加平滑但持续的融合削弱了模型对插槽位置的精细修正任务得分降至 27.5。相比之下train 得分 70 分且仅需 12.1 秒在基本保持精度的同时缩短了完成时间并降低了 jerk。train 能够避免这一问题是因为它只在延迟区域施加硬约束进入 overlap 区域后不再继续限制模型保留了对精细位置进行修正的空间。长时序任务放入微波炉测试长序列中等待时间的累计代价。该任务对单步精度要求不高train 和 sync 均达到 96 分。但每次动作交接时的等待不断累积导致 sync 总耗时达到 85.18 秒而 train 通过连续执行仅用 68.9 秒完成了相同任务也更直观地体现了 RTC 对整体执行效率的提升。05 连续性约束的代价与开放世界的缺口Motubrain 团队的这组实证研究为 WAM 的实时部署提供了一组较完整的对比也指出了当前 RTC 方法仍然存在的局限。现有 RTC 策略大多基于一个隐含假设前序动作通常可以为下一段动作提供有效参考。这一假设在相对稳定的环境中成立但在开放环境中并不总是如此——当突然出现障碍物或者目标位置发生明显变化时新 chunk 可能需要快速偏离旧轨迹。此时前缀约束不但无法帮助动作衔接反而可能限制机器人及时调整。对于 WAM 而言这个问题还会更加复杂历史前缀约束不仅影响动作输出还会影响模型对未来视觉场景的预测——双重风险的叠加意味着模型可能既做出错误的动作又对错误的视觉预测“深信不疑”。研究中给出了一个场景示意当障碍物突然出现时chunk n1 必须偏离 chunk n 的轨迹。而此时前缀约束train或加权融合simple/asyncblend都在试图将新动作“拉回”到旧轨迹上。这也是连续性约束本身的代价在需要快速改变动作的时候过去的轨迹可能反而成为限制。机器人的“实时性”并不是单纯提高模型推理速度就能解决的问题。它涉及推理调度、时序对齐、跨 chunk 连续性和环境响应能力等多个环节。RTC 首先解决的是动作连续执行的问题但再往前一步还需要回答另一个问题面对不同环境变化系统应该在什么时候保持连续又在什么时候允许机器人迅速偏离原来的轨迹。这也是 WAM 从相对稳定的实验环境走向更复杂开放场景时还需要继续解决的问题。Ref论文链接https://arxiv.org/pdf/2608.01880博客链接https://www.motubrain.com/zh/researchGithub链接https://github.com/shengshu-ai/Motubrain
返回列表