写在最前从小米my16和宇树科技的WVLA2.0思考2028具身智能可能会迎来ChatGPT时刻VLA世界模型可能会成为主流范式。目录一、RT-1的提出背景与模型定位1.1 RT-1要解决什么问题1.2 RT-1为什么使用Transformer1.3 RT-1属于VLA吗二、RT-1的数据组织与动作表示2.1 Episode是什么2.2 Episode如何变成训练样本2.3 训练标签到底是什么2.4 RT-1的动作空间2.5 连续动作如何变成动作Token2.6 动作Token与语言词表没有关系三、RT-1的模型结构与视觉语言融合3.1 整体结构3.2 语言如何处理Universal Sentence Encoder3.3 语言和视觉不是简单拼接3.4 FiLM如何把语言写入视觉特征3.5 Identity-Initialized FiLM3.6 图像如何变成视觉Token3.7 TokenLearner如何压缩视觉Token3.8 Transformer如何生成动作四、RT-1的训练过程4.1 训练方式行为克隆4.2 完整训练数据流4.3 动作分类损失4.4 因果掩码与时间信息4.5 RT-1不是强化学习五、RT-1的推理与闭环控制5.1 推理过程5.2 为什么是闭环控制5.3 预测动作和实际位移的区别5.4 控制频率与终止六、RT-1的数据规模、能力与实验意义6.1 数据规模6.2 任务类型6.3 数据多样性的重要性6.4 异构数据吸收能力6.5 泛化与鲁棒性6.6 与SayCan的配合七、RT-1的贡献、局限与技术演进7.1 RT-1的核心贡献7.2 RT-1的主要局限7.3 RT-1、RT-2与π₀的演进关系7.4 整体总结哲学视角一、RT-1的提出背景与模型定位1.1 RT-1要解决什么问题RT-1全称为Robotics Transformer 1是Google Robotics与Everyday Robots团队于2022年提出的多任务机器人策略模型。传统机器人学习通常针对单一任务训练单独策略例如抓取杯子、打开抽屉、移动物体可能分别需要不同模型。RT-1希望验证能否训练一个统一的Transformer策略使其同时吸收不同任务、物体、环境以及机器人平台的数据并随着数据规模和任务多样性的增加获得更强的泛化能力。RT-1可以表示为一个条件策略其中i表示本次任务的语言指令x≤t表示截至时间t的视觉观察at表示机器人当前需要执行的动作πθ表示参数为θ的机器人策略。其核心任务可以概括为语言指令最近一段视觉观察→当前机器人动作。例如输入指令“打开上方抽屉”机器人根据最近看到的画面依次预测靠近把手、调整夹爪、闭合夹爪和向后拉动等动作。1.2 RT-1为什么使用Transformer机器人当前应该做什么不仅取决于当前画面还取决于过去几帧发生了什么。例如一张静态图像只能显示夹爪位于杯子附近却无法判断夹爪是在靠近杯子还是刚刚离开杯子。RT-1使用Transformer处理最近6帧视觉特征通过自注意力综合分析目标物体、夹爪位置以及短期运动趋势再预测下一步动作。Transformer在RT-1中的作用不是负责理解原始文字而是处理已经融入语言条件的多帧视觉Token多帧视觉语言Token→Transformer→动作Token1.3 RT-1属于VLA吗RT-1同时涉及视觉、语言和动作但它没有从互联网规模的视觉语言模型VLM出发也没有把完整语言Token、视觉Token和动作Token统一到同一套生成框架中。语言在RT-1中主要作为视觉编码器的任务条件因此更准确的定位是RT-1语言条件下的大规模多任务机器人策略模型。它是后来VLA路线的重要前身但并不是RT-2之后所定义的完整VLA基础模型。RT-1的主要突破是证明机器人策略也能通过统一模型、大规模数据和多任务训练获得泛化能力。二、RT-1的数据组织与动作表示2.1 Episode是什么从任务开始到任务结束的一次完整机器人交互称为一个Episode可以表示为其中i表示整条轨迹对应的语言指令xj表示第j个时间步的观察图像aj表示机器人看到xj后执行的动作x0表示初始观察xT表示执行完最后一个动作后的终止观察。例如语言指令是“打开上方抽屉”完整过程可以表示为机器人先在x0中看到关闭的抽屉执行靠近把手的动作a0得到新的画面x1后再调整夹爪方向之后完成对齐、闭合夹爪和拉动最终在xT中看到已经打开的抽屉。2.2 Episode如何变成训练样本Episode是一条完整任务轨迹训练样本则是从轨迹的某个时间点切出来的数据。RT-1在第t个时间步使用语言指令和最近6帧图像预测专家动作因此一条包含大量时间步的Episode可以形成很多训练样本模型输入中的6帧图像是用于理解当前状态和运动趋势不是用来计算“第1帧到第6帧实际移动了多少”。2.3 训练标签到底是什么训练标签at是人类遥操作员在时间步t真实下发给机器人的控制指令而不是通过比较前后图像计算出的视觉位移。数据采集系统会按照时间戳同步记录语言指令相机图像遥操作控制指令机器人状态例如最近6帧显示夹爪逐渐靠近杯子操作员此时下发的控制指令可能是这组指令就是当前样本的监督标签。如果操作员此时没有移动机械臂对应的部分动作值可以接近0。这类“零动作”不一定是无效数据因为机器人本身也需要学习保持姿态、停止移动和短暂等待。但如果数据中存在大量无意义停顿模型可能形成“不确定时倾向于不动”的偏差所以实际数据处理中通常需要过滤过长的静止片段、控制零动作样本比例并保留真正有意义的保持动作。2.4 RT-1的动作空间RT-1的动作包含11个维度。机械臂动作有7维x,y,z表示末端执行器的三维平移roll,pitch,yaw表示三维旋转gripper表示夹爪开合。移动底盘动作有3维另外还有一个模式变量分别表示当前控制机械臂、控制移动底盘或者终止当前Episode。因此可以将完整动作写成RT-1输出的是较高层的末端位姿增量、夹爪和底盘控制量而不是直接输出每个电机的电流。机器人底层控制器仍负责把这些目标转换为关节和电机信号。2.5 连续动作如何变成动作Token机器人动作原本是连续值例如RT-1不直接回归连续动作而是将每个连续动作维度的有效范围均匀划分为256个区间。对于第d个动作维度设其范围为[ld,ud]可以概念化地量化为其中at(d)表示真实连续动作值kd表示量化后的动作Token。假设某个动作维度范围为[−1,1]则Token 0接近最大负向动作Token 128接近0Token 255接近最大正向动作。RT-1每个控制周期预测的是一组动作Token这些动作维度可以并行预测不需要像语言模型生成句子一样逐个自回归输出。2.6 动作Token与语言词表没有关系RT-1中的动作Token只是某个动作维度的量化档位不属于语言词表语言Token 128词表中的某个文字或子词动作Token 128某动作维度的第128个量化区间即使编号相同两者也没有任何语义关系。RT-1训练的是独立的动作分类空间而不是让语言模型词表直接表示动作。模型输出动作Token后还需要反量化为连续控制量三、RT-1的模型结构与视觉语言融合3.1 整体结构RT-1的完整模型结构可以概括为前置语言指令→USE语言向量→FiLM调制EfficientNet为FiLM-EfficientNet后处理最近6帧图像→经过FiLM-EfficientNet→每帧9×9×512特征图→每帧81个Token→TokenLearner→每帧8个Token→6帧×848个Token→Transformer→11维动作Token其中语言不作为独立文本Token进入主Transformer而是在图像特征生成阶段提前融入视觉表示。3.2 语言如何处理Universal Sentence Encoder语言指令先经过Universal Sentence Encoder简称USE被编码成一个固定长度的句子语义向量例如i“拿起桌面上的红色杯子”经过USE后得到这个向量整体表示“拿起”这一动作意图、“杯子”这一目标对象、“红色”这一属性以及“桌面上”这一空间关系。需要注意不能理解成某一维单独代表“拿起”另一维单独代表“杯子”语义信息分布在整个高维向量中。RT-1的主Transformer不会直接看到“拿起”“红色”“杯子”等原始文本Token它接收到的是语言向量已经调制过的视觉特征。3.3 语言和视觉不是简单拼接常见的多模态方式可能是把视觉向量和语言向量直接拼接RT-1没有采用这种后期拼接方式而是使用FiLM进行早期语言融合。两种方式的直观区别是直接拼接先独立看图先独立理解语言→最后融合RT-1先理解任务→带着任务去看图因此RT-1进入Transformer的不是[视觉Token][语言Token],而是已经被语言条件化的视觉特征Token.3.4 FiLM如何把语言写入视觉特征EfficientNet处理中间图像时会产生视觉特征图其中H,W表示空间尺寸C表示特征通道数。语言向量经过小型网络后生成两组参数FiLM使用这两组参数调节图像特征其中γ用于调整不同视觉特征通道的缩放强度β用于调整偏移F′表示融入当前语言任务后的视觉特征。假设同一张画面中同时存在红色杯子、蓝色碗、抽屉和机器人夹爪。当指令为“拿起红色杯子”时模型会更强调与红色、杯子、夹爪和抓取区域有关的特征当指令变为“打开抽屉”时同一张图像会更强调抽屉、把手和夹爪之间的关系。因此同一张图像不同语言指令→不同视觉特征FiLM不会直接输出“杯子位于哪个像素”空间位置仍由图像特征图保存。语言的作用是改变模型应该重点提取和保留哪些视觉信息。3.5 Identity-Initialized FiLMEfficientNet-B3已经在ImageNet上完成预训练拥有较好的视觉特征提取能力。如果FiLM参数完全随机初始化训练开始时可能会破坏EfficientNet已有的视觉表示。因此RT-1让FiLM初始时接近恒等变换初始化时因此训练初期先保留预训练视觉能力之后再通过机器人数据逐渐学会不同语言指令应该增强或抑制哪些视觉特征。3.6 图像如何变成视觉TokenRT-1在每个控制时刻使用最近6张分辨率为300×300的RGB图像。每张图像经过FiLM-EfficientNet-B3后得到这表示图像被编码成9×9个空间位置每个位置对应一个512维特征向量。将空间维度展开得到其中每个fp就是一个视觉特征Token。这里的Token不是离散编号而是连续浮点向量例如这些Token既包含相应空间位置的视觉信息也包含FiLM注入的语言任务条件因此可以称为视觉语言Token。RT-1与ViT的Token化方式不同ViT原始图像Patch→Patch TokenRT-1原图→CNN特征图→空间特征Token3.7 TokenLearner如何压缩视觉Token如果每帧保留81个Token6帧一共会产生81×6486个Token不利于实时控制。RT-1使用TokenLearner将每帧81个视觉Token压缩为8个。第k个输出Token可以概念化表示为其中fp表示第p个空间位置的特征向量αk,p表示第k组注意权重对该位置的关注程度zk表示加权聚合后的Token。TokenLearner不是固定截取8块区域也不是选择数值最大的8个Token而是学习8组不同的空间权重对原来的81个位置进行软聚合。从直觉上看这些Token可能分别聚合目标物体、夹爪、容器、抽屉把手、障碍物以及相对位置等信息但这些关注模式不是人工指定的而是由最终动作预测损失自动学习。每帧压缩成8个Token后最近6帧总共形成6×848个Token再加入位置和时间顺序信息送入Transformer。3.8 Transformer如何生成动作RT-1使用8层Decoder-only Transformer处理48个视觉语言Token。Transformer通过自注意力综合判断目标物体在哪里、夹爪当前在哪里、过去几帧如何移动、物体是否已经被抓住、任务是否接近完成以及下一步应该继续靠近、闭合夹爪还是移动底盘。需要特别强调主Transformer实际看到的是多帧、带语言条件的视觉特征Token而不是原始图像、文本Token和动作Token的直接拼接。四、RT-1的训练过程4.1 训练方式行为克隆RT-1主要使用模仿学习中的行为克隆。训练数据来自人类遥操作机器人成功完成任务的示范模型学习的是在当前语言和视觉状态下专家会执行什么动作行为克隆目标可以表示为其中D表示训练Episode集合at expert表示遥操作员在时间步t真实下发的专家动作。4.2 完整训练数据流RT-1的训练过程可以概括为①数据成功Episode→沿时间轴切分训练样本②语言语言指令→USE→FiLM调制③视觉语言融合视觉特征6帧图像→FiLMEfficientNet→TokenLearner④训练48个视觉语言Token→Transformer预测动作Token→与专家动作Token计算损失模型在训练阶段可以看到专家动作标签推理阶段则没有标签只能依靠当前图像和语言自主预测。4.3 动作分类损失由于每个连续动作维度被量化成离散类别RT-1可以将训练损失理解为多个动作维度分类交叉熵之和其中pθ(d)表示模型对第d个动作维度的分类概率kd expert表示专家动作对应的真实量化档位。离散分类的优点是训练相对稳定但也存在一个问题交叉熵会把所有错误类别视为相互独立。例如真实Token是128预测127通常比预测20更接近真实动作但普通分类损失本身不会充分表达这种物理距离关系。4.4 因果掩码与时间信息RT-1使用因果掩码保证模型预测当前时间步动作时不能看到未来观察和未来动作。训练样本虽然来自完整Episode但模型只能利用当前及之前的视觉信息这样训练过程才能与实际部署保持一致。4.5 RT-1不是强化学习Episode可以带有任务是否成功的终止结果但RT-1的主要参数学习不依赖在线奖励试错。它主要从成功的专家示范中监督学习下一步动作。因此RT-1主要训练方式模仿学习中的行为克隆而不是随机探索环境奖励→在线强化学习五、RT-1的推理与闭环控制5.1 推理过程RT-1部署后按照以下顺序运行①用户输入语言指令②机器人获取最近6帧相机图像③USE把语言指令编码为句子向量④FiLM-EfficientNet生成语言条件化的图像特征⑤TokenLearner将每帧81个Token压缩为8个⑥Transformer预测当前的一组动作Token⑦动作Token反量化为连续控制量⑧底层控制器驱动机械臂或底盘⑨相机获得新的真实画面⑩更新6帧视觉窗口并继续预测。其闭环可以表示为5.2 为什么是闭环控制RT-1不会一次生成完整任务轨迹后从头执行到底而是每次执行当前控制周期的动作然后重新观察真实环境观察→动作→新观察→新动作如果夹爪没有按照预期到达目标位置或者物体发生移动新画面会在下一次预测中反映这些变化模型可以继续修正动作。5.3 预测动作和实际位移的区别RT-1输出的是动作控制指令而不是环境一定会发生的实际位移。例如模型输出“向前移动”但如果机械臂发生碰撞、受到关节限位或底层控制器未能完全执行真实位移可能小于指令值。下一步模型会根据新的真实图像重新判断而不是假设上一步动作一定完全执行成功。因此需要区分模型动作at希望机器人执行的控制量实际状态变化xt→xt1机器人和环境共同产生的结果5.4 控制频率与终止RT-1以约3Hz频率输出动作即每秒大约进行3次策略决策。模型持续进行闭环预测直到输出terminate模式或达到系统设置的最大时间步。3Hz对于抓取、移动和开抽屉等相对低频操作可以工作但对于快速、灵巧和高频接触操作仍然有限。这也是后续模型开始使用动作块、连续动作专家和更高控制频率的重要原因。六、RT-1的数据规模、能力与实验意义6.1 数据规模RT-1的主要数据集由13台Everyday Robots机器人在17个月内采集包含超过13万个真实机器人Episode和700多种任务。机器人具备7自由度机械臂、双指夹爪以及移动底盘数据主要由人类遥操作采集并为每条Episode配套语言指令。大规模真实机器人数据收集本身并不只是“保存视频”。数据系统需要同步记录图像、语言、操作员控制指令、机器人状态和时间戳还需要反复摆放物体、重置环境、处理失败轨迹以及维护机器人设备。记录数据相对容易真正困难的是稳定、长期、高质量地采集足够多样的数据。6.2 任务类型训练任务包括抓取和放置物体、打开或关闭抽屉、从抽屉中取出物体、将物体放入容器、把细长物体竖直放置或推倒、抽取餐巾纸以及打开罐子等。语言指令通常可以拆成“技能目标对象”例如这种任务组织方式可以测试模型是否能够把已经见过的技能和物体重新组合完成训练中没有直接出现过的新指令。6.3 数据多样性的重要性RT-1的实验说明机器人数据不仅要多还要覆盖足够多的任务、物体、背景和场景。即使总样本量保持较高如果任务种类明显减少模型的泛化能力仍会下降。这说明机器人数据的价值不能只用Episode数量衡量还需要关注任务多样性物体多样性环境多样性机器人多样性6.4 异构数据吸收能力RT-1还验证了加入仿真数据和其他机器人平台数据的可能性。这说明统一策略模型可以尝试吸收不同来源的数据而不是每个机器人平台完全独立训练。不过不同机器人动作空间和观察方式并不完全一致异构数据必须经过动作空间对齐、输入格式统一或平台标识处理才能被同一个策略有效利用。6.5 泛化与鲁棒性RT-1能够在数百种训练任务上工作并对新的技能—物体组合、不同背景和干扰物表现出一定泛化和鲁棒性。例如模型学习过“拿起杯子”和“移动罐子”后可能对新的“移动杯子”组合产生一定迁移能力。但这种泛化主要建立在已有技能和已有对象概念的重新组合上并不代表模型能够凭空掌握训练数据中完全没有的世界知识或复杂动作。6.6 与SayCan的配合RT-1主要负责低层技能执行不擅长独立完成复杂长时规划。对于“整理桌面”这种任务可以由SayCan或其他高层规划系统先拆成找到物体→抓取物体→移动到抽屉→放入抽屉RT-1再逐个执行这些语言子指令。因此可以理解为SayCan决定下一项技能RT-1把当前技能转成机器人动作七、RT-1的贡献、局限与技术演进7.1 RT-1的核心贡献第一RT-1证明了统一机器人策略能够从大规模、多任务真实机器人数据中学习而不必为每个任务单独训练模型。第二它把机器人控制工程化地转化为Token序列建模问题视觉表示为连续特征Token语言通过FiLM写入视觉特征连续动作离散为动作Token最后由Transformer完成从视觉历史到动作的映射。第三RT-1围绕实时控制进行了专门设计通过TokenLearner减少视觉Token数量并使用并行动作分类使模型能够以约3Hz频率运行在真实机器人闭环中。其核心结构可以概括为语言条件视觉编码时序Transformer离散动作预测7.2 RT-1的主要局限第一RT-1依赖专家示范。行为克隆只能学习数据中存在的动作模式离开示范分布后容易累积误差。第二语言理解能力有限。USE将整条指令压缩为句子向量语言主要承担任务条件作用模型没有继承互联网规模VLM中的开放语义和世界知识。第三动作离散化存在量化误差连续控制只能用256个档位近似表示。第四RT-1每次主要生成当前控制周期的一组动作没有像ACT或π₀一样输出未来多个时间步的动作块。第五3Hz控制频率和单步动作形式对于快速、灵巧和高频接触任务仍然有限。第六RT-1没有显式世界模型不能直接预测不同候选动作会如何改变未来环境它主要通过观察当前状态直接做出反应。第七复杂长时任务仍然依赖SayCan等外部规划系统。7.3 RT-1、RT-2与π₀的演进关系对比项RT-1RT-2π₀模型定位语言条件多任务机器人策略视觉语言动作VLA通用机器人基础策略基础模型EfficientNet小型Transformer互联网预训练VLM预训练VLMAction Expert语言处理USE句子向量完整语言Token完整语言Token视觉语言融合FiLM调制视觉特征VLM内部多模态联合建模VLM为动作专家提供条件视觉输入最近6帧图像主要使用当前图像多视角图像和机器人状态动作表示11维单步离散动作Token映射到VLM词表的动作Token连续多步动作块动作生成并行动作分类自回归生成动作TokenFlow Matching生成连续动作主要数据机器人示范Web图文数据机器人示范多机器人预训练任务后训练主要意义证明机器人策略可以规模化将互联网知识迁移到动作加强高频连续动作建模三者的演进主线可以概括为RT-1大规模机器人数据→统一多任务策略RT-2互联网VLM机器人数据→VLAπ0预训练VLM多本体数据连续动作专家→通用机器人基础模型RT-1解决的是“能不能用一个模型学习大量机器人任务”RT-2进一步解决“能不能把互联网知识迁移给机器人”π₀则进一步加强动作侧使用专门Action Expert和Flow Matching生成连续、多时间步动作。7.4 整体总结RT-1的完整过程可以压缩为成功Episode→切分为观察—动作训练样本语言指令→USE句子向量→FiLM调制视觉特征6帧图像→EfficientNet→每帧81个视觉语言TokenTokenLearner→每帧8个Token→共48个时序TokenTransformer→11维动作Token→反量化底层控制器执行→获得新图像→继续闭环预测RT-1需要重点记住八点①RT-1是语言条件下的大规模多任务机器人策略不是互联网VLM意义上的完整VLA②一条Episode会沿时间轴切成很多“语言最近6帧图像→专家动作”的训练样本③训练标签是遥操作员真实下发的动作指令不是根据6帧图像差计算出的实际位移④语言先经过USE变成句子向量再通过FiLM写入视觉特征⑤视觉Token是CNN特征图展开得到的连续向量不是语言词表编号⑥TokenLearner将每帧81个Token软聚合为8个使6帧总共只保留48个Token⑦模型并行预测一组离散动作Token动作Token与语言词表无关⑧RT-1通过行为克隆和短周期闭环控制完成多任务机器人操作并为RT-2和后续VLA基础模型奠定了统一策略和数据规模化基础。哲学视角“机器人不是先听懂语言而是先学会带着指令看世界。”——当语言指令经USE压成句子向量FiLM把任务写入视觉特征TokenLearner将每帧81个位置收束为8个TokenTransformer再从6帧、48个时序Token中预测11维动作RT-1便把“理解”落到了夹爪、底盘与终止信号上而3Hz的观察—动作—新观察闭环又让每一次执行都接受现实纠偏。它表面上是在训练机器人听话本质上是在把语言翻译成选择、把感知翻译成行动。真正改变的不是机器多会识别物体而是它能否在连续反馈中把一句指令变成一条可修正、可复现、可扩展的行动路径。结尾语如果本文对您有帮助请点赞鼓励一下这对我真的很重要。您的每一次鼓励都是我继续创作的动力谢谢啦下次见。