尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

078、ACT动作分块Transformer:CVAE架构与机器人精细操作

078、ACT动作分块Transformer:CVAE架构与机器人精细操作 078、ACT动作分块Transformer:CVAE架构与机器人精细操作调试ACT模型的时候,我盯着示教轨迹和预测轨迹的对比曲线,发现了一个让人抓狂的现象:模型在关节空间里预测的动作序列,前20个时间步跟真实轨迹贴合得近乎完美,但从第25步开始,预测值就像喝醉了酒一样开始漂移,到第40步已经完全偏离了示教轨迹。这不是过拟合,也不是学习率的问题——这是动作分块Transformer在训练和推理阶段的一个本质性差异在作祟。今天这篇笔记,我想把ACT(Action Chunking with Transformers)这个架构掰开揉碎了讲清楚,特别是它里面那个CVAE(Conditional Variational Autoencoder)到底在扮演什么角色,以及为什么它能解决精细操作任务里那些让人头疼的问题。先说说我最初踩的那个坑。当时我在做一个精密装配任务,要求机器人把直径0.5mm的销钉插入对应的孔中,间隙只有0.05mm。用传统的RL方法训练,策略网络输出的动作噪声稍微大一点,销钉就会卡在孔口。后来换用行为克隆,直接模仿示教轨迹,但问题更明显了——BC本质上是在学习一个条件概率分布p(a_t | s_t),它假设每个时间步的动作只依赖于当前状态。这个假设在大多数情况下是合理的,但在精细操作场景下,它忽略了一个关键信息:当前这一步的动作应该和之前几步的动作保持连贯性,而且这种连贯性不是简单的马尔可夫性质能捕捉的。ACT的核心思路其实很直接:与其一个时间步一个时间步地预测动作,不如一次性预测未来一段时间内的整段动作序列。这个"动作分块"的思想,让模型能够显式地建模动作之间的时序依赖。但仅仅分块还不够,因为分块后的动作序列预测变成了一个高维回
返回列表