尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

具身智能论文学习5:RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

具身智能论文学习5:RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control 第一部分论文基本收录情况项目内容英文题目RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control中文译名RT-2视觉—语言—动作模型将网络知识迁移到机器人控制模型全称Robotic Transformer 2正式版第一作者Brianna Zitkovich主要研究团队Google/Google DeepMind等大规模联合研究团队研究方向视觉—语言—动作模型、机器人学习、具身智能、机器人操作发表年份2023录用会议The 7th Conference on Robot LearningCoRL 2023机器人学习大会展示形式CoRL 2023 Oral口头报告论文正式论文集Proceedings of Machine Learning ResearchPMLR Volume 229页码2165–2183会议时间2023年11月6日至9日会议地点美国亚特兰大正式出版时间2023年12月2日第二部分解决的问题如何把 Web-scale 预训练 VLM 的视觉、语义和推理知识直接迁移到低层机器人控制使一个模型同时完成视觉观测Vision 语言指令Language →动作token并提高机器人对新物体、新场景和新指令的泛化能力先前论文的不足Previous LimitationRT-1 有 Action 但缺 Web-scale knowledgePaLM-E/SayCan 有知识和推理但与 low-level Action 仍然分离。1RT-1 会控制但“知识太少”RT-1 已经实现RGB Language ↓ RT-1 ↓ Robot Action但 RT-1 的语义知识主要来自130k 左右真实机器人 demonstration。机器人数据和 Web 数据相比太小了。论文指出最强 VLM/LLM 是用数十亿级文本、图像训练的而机器人短期内几乎不可能收集到同量级的交互数据。所以 RT-1 容易学会pick apple但遇到“pick the object that is different”“move apple to number 3”“把苹果移到绿色杯子旁边”这种 robot demonstration 没教过的开放语义概念能力有限。2SayCan / PaLM-E 有知识但 Action 还在外面SayCanLLM ↓ High-level Skill ↓ Low-level PolicyPaLM-EImage Language ↓ PaLM-E ↓ Textual Plan ↓ RT-1 / Low-level Policy ↓ Action问题就是互联网知识主要停留在高层 planner而真正输出 motor action 的 low-level controller 并没有直接享受到这些知识。第三部分RT2框架1输入和输出RGB Language → Action TokensRobot RGB Camera Image Language Instruction ↓ Pretrained VLM (PaLI-X / PaLM-E) ↓ RT-2 ↓ Action Tokens ↓ De-tokenize ↓ Low-level Robot Action2VLM 如何变成 VLA①传统两阶段模块的局限传统机器人系统通常是图像 语言指令 ↓ VLM / LLM 高层规划器 ↓ “抓取杯子”“移动到桌边”等技能指令 ↓ 另一个独立的低层动作策略 ↓ 机器人动作也就是VLM高层理解模块独立低层控制策略前面的 VLM 负责理解和规划后面的机器人策略负责执行。两个模块通常分开训练高层 VLM 的互联网知识并没有直接进入低层动作模型。②RT-2 是一个统一的 VLA 策略模型RT-2 的核心形式是机器人图像语言任务指令→同一个模型→动作训练时同一个模型同时学习两类任务视觉语言任务图像问题→文本答案以及机器人控制任务机器人图像任务指令→动作token即文本答案和机器人动作都被处理成 token由同一个 VLM 的自回归解码器生成。RT-2 实际上分为两个阶段第一阶段先获得预训练 VLM作者使用已经在互联网规模图文数据上训练好的PaLI-XPaLM-E。此时它们已经具备视觉理解、语言理解和语义推理能力但还不会直接输出机器人动作。第二阶段进行 Co-Fine-Tuning随后不是只拿机器人数据微调而是同时使用原始互联网视觉语言数据机器人轨迹数据对整个 VLM 进行协同微调使其既能继续输出普通语言又能输出动作 token。3模型训练方式研究方法初始模型后续训练数据含义From Scratch随机初始化训练数据从零学Robot-only Fine-Tuning预训练 VLM只用机器人数据有VLM基础再“只”学机器人Co-Fine-Tuning预训练 VLM机器人 Web VL 数据一边学机器人一边保留原来的视觉语言知识Figure 6(b) 说明VLM 预训练是 RT-2 泛化能力的基础Co-Fine-Tuning 比只用机器人数据微调更好同时更大的模型通常泛化更强。从头训练表现最差而“预训练 VLM Web 数据与机器人数据联合微调”整体效果最好。4动作 token和机器人动作相互转化①RT-2原始机器人动作组成论文中的动作包含一共8个动作分量分量含义是否结束当前任务末端执行器位置变化末端执行器旋转变化夹爪开合状态②连续动作无法直接作为文本输出原始动作通常是连续数值但VLM原本输出的是离散token所以必须把连续值离散化。例如满足③离散化方式RT-2把每个连续动作维度均匀划分256个区间。连续值先映射成中的一个整数。例如这里的128不是实际位移而是该连续动作值所在区间的编号。④把区间编号变成token前一步已经把连续动作值比如离散成了某个区间编号这个128 只是一个 bin 的编号不是语言模型真正要预测的token。再转化这样处理之后机器人控制就被改写成了语言模型熟悉的形式“根据前文预测下一个token”⑤推理时恢复动作反token化模型生成动作token以后需要进行反token化“动作token→bin编号→连续动作值”最终得到再发送给机器人控制系统执行。5互联网视觉语言知识迁移到机器人控制要解决的核心问题是模型在网页图像、文本和视觉问答中学到的知识为什么能够帮助机器人完成未见过的任务①迁移依靠的训练方式核心是Co-Fine-Tuning协同微调训练时同时保留两类数据。视觉语言数据图像问题→文本答案例如图像香蕉、苹果和葡萄 问题图中有哪些水果 答案香蕉、苹果和葡萄机器人轨迹数据机器人图像任务指令→动作token例如机器人图像桌面上有香蕉和罐头 任务把香蕉放进碗里 输出动作token序列同一个模型同时处理两类任务论文指出机器人数据在训练混合中需要被适当提高采样权重以平衡大规模视觉语言数据与数量较少的机器人数据。②不能只用机器人数据微调即Robot-only Fine-Tuning假设先有一个预训练VLM然后只用机器人轨迹继续微调预训练VLM→只使用机器人数据微调这种方式可能带来两个问题模型逐渐遗忘原有视觉语言知识模型容易局限于机器人训练数据里出现过的物体和指令。而Co-Fine-Tuning在训练机器人任务时仍不断让模型处理原来的视觉语言任务机器人数据原始视觉语言数据这样可以更好地保留物体识别能力颜色和属性知识常识知识语言理解能力视觉语义推理能力。所以它不是简单的 先训练VLM再用机器人数据覆盖它而是让视觉语言能力和机器人动作能力共同保留在一个模型中6闭环机器人控制流程RT-2不是只预测一次动作序列然后完全不再观察环境。其控制流程是获取当前机器人图像 → 生成当前动作token → 反token化为动作 → 机器人执行 → 获取新图像 → 再次预测这是闭环控制。RT-2可以被理解成一个策略()由参数 () 决定的机器人策略也就是RT-2()当前观测()任务语言指令()当前应该采取的动作。控制思想和PaLM-2一样都是不断“看—决策—执行—再看”区别在于PaLM-E高层 Skill-level Closed Loop​RT-2低层 Action-level Closed Loop​但要注意推理频率RT-2-PaLI-X 55B约为1–3 Hz较小的5B模型约为5 Hz。因此它输出的是相对低频的笛卡尔动作命令并不是电机级高频控制器。7整体流程核心模块①蓝色方框视觉 token蓝色方框表示当前机器人图像经过 ViT 后得到的视觉特征即机器人相机图像 ↓ ViT ↓ 视觉 embedding / 视觉 token一张图像通常不会只变成一个token而会变成多个视觉token所以图中画了多个蓝色方框。这些视觉token负责告诉模型场景里有什么物体物体在哪里机械臂当前处于什么位置哪个袋子快掉下桌面哪个物体与其他物体不同。② 橙色方框文字 token橙色方框表示语言提示和任务指令经过tokenizer、embedding后的文字token。例如RT-2使用类似这样的提示Q: What action should the robot take to [pick up the red cup]? A:对应所以橙色token中包含固定的问题模板用户的语言任务Q:、A:等提示内容任务对象和动作描述。例如pick | up | the | red | cup会被表示为多个橙色文字token。③紫色方框动作 token表示RT-2最终生成的机器人动作token例如模型可能生成1 128 91 241 5 101 127 255它们分别对应动作的各个分量这些数字不是直接的物理值而是连续动作离散化后得到的bin编号连续动作值→0255号bin→动作token然后再执行紫色动作token→De-Tokenize→连续机器人动作论文将动作作为文本token形式输出并在机器人任务解码时把输出限制在合法动作token范围内。平移变化量例如x 方向移动 0.1y 方向移动 −0.2z 方向不动旋转变化量例如roll转 10∘pitch转 25∘yaw转 −7∘⑤灰色方框它主要是示意性的“非重点位置”普通但未特别强调的序列位置自回归生成过程中其他token位置中间输出或非动作目标位置图示中的占位。尤其是下方灰色框可以理解为模型在各个序列位置都有隐藏表示或输出预测但在机器人动作任务中真正被取出来并组成动作序列的是紫色部分。⑥整体含义也就是视觉token蓝色语言token橙色→RT-2→动作token紫色8自回归式生成RT-2 把动作也变成 token 就可以沿用语言模型原本的“自回归生成”方式来生成一组动作 token。针对一个机器人训练样本条件输入当前机器人相机观测语言任务指令。例如当前图像 “拿起红色杯子”输出目标这8个是当前动作的8个动作 token对应terminate是终止信号因此从“输入—输出任务”角度看但是动作 token 是逐个生成的RT-2沿用了语言模型的自回归生成方式。它并不是一次独立地同时预测8个毫无关系的动作 token而是其中意思是第1个动作 token只根据图像和语言指令预测第2个动作 token根据图像、指令和第1个动作 token 预测第3个动作 token根据图像、指令和前两个动作 token 预测依次继续。例如然后再然后第四部分实验效果1主性能结果①三类测评场景Figure 3展示了RT-2总体泛化评测所采用的三类分布外场景。Unseen Objects主要改变机器人需要操作的目标物体用于测试已有动作技能向新物体的迁移Unseen Backgrounds主要改变桌面纹理、覆盖物和视觉干扰用于测试模型对背景变化的鲁棒性Unseen Environments则改变整个工作区、空间布局和周围物体用于测试机器人策略向全新真实环境的迁移。②具体测评效果RT-2在 seen robot tasks 上保持 RT-1 水平但在unseen objects / backgrounds / environments 上将平均成功率从约 32–35% 提升到 62%表明 Web-scale VLM knowledge 主要带来的是泛化能力。Seen、新物体 Easy、新物体 Hard、新背景 Easy、新背景 Hard、新环境 Easy、新环境 Hard、Unseen平均。然后Figure 4把easy和hard二者取平均2Web 知识迁移带来的新任务泛化它想证明的核心是机器人数据提供“怎么抓、怎么移动、怎么放”网络数据提供“抓什么、放到哪里、为什么”最终形成已有运动技能新的语义理解与推理→新的机器人任务论文将这些能力称为emergent capabilities涌现能力。这里的“涌现”不是指机器人凭空学会了全新的手部动作而是指它能将机器人数据中学到的抓取、移动和放置动作用于机器人演示数据中没有出现过的新语义任务。第一类场景推理与关系理解1. Put strawberry into the correct bowl把草莓放进正确的碗里。这个任务不是简单的抓草莓 → 随便放进一个碗模型还需要理解哪个物体是草莓哪些物体是碗草莓属于哪一类物体哪个碗中放着相似的水果“correct bowl”所表达的语义关系。论文特别解释这个任务要求模型理解草莓应当与相似水果放在一起。也就是识别草莓理解水果类别判断正确容器执行抓取放置2. Pick up the bag about to fall off the table拿起那个快要从桌子上掉下去的袋子。场景中可能有多个袋子因此只识别“袋子”还不够。模型需要比较哪个袋子距离桌边更近哪个袋子处于不稳定状态“about to fall”是什么意思。因此它需要进行物体识别空间位置判断物理状态推断最后选中快掉落的袋子。论文把这一任务作为物理理解和关系消歧的例子模型要在两个袋子之间找到处于危险位置的那个。3. Place orange in matching bowl把橙子放进与其匹配的碗里。这里的关键词是matching模型不能只识别橙子还要观察不同碗中的物体、颜色或类别判断哪个碗与橙子匹配。它体现的是目标识别属性匹配关系推理4. Move soccer ball to basketball把足球移动到篮球旁边。模型必须先区分足球篮球其他球状物体。然后理解指令中的两个语义角色被移动物体足球目标位置篮球旁边最后利用已有的移动技能执行。5. Move cup to the wine bottle把杯子移动到葡萄酒瓶旁边。这同样不是预先固定好的位置坐标而是一个相对目标目标位置葡萄酒瓶所在位置附近模型需要先在图像中找到葡萄酒瓶再把它作为动作目标位置。6. Pick animal with different colour拿起颜色与其他动物不同的动物。这需要同时完成找出所有动物玩具判断每个动物的颜色比较它们找出颜色不同的那个执行抓取。这属于典型的比较推理多个候选物体→比较属性→选择异常项7. Pick land animal拿起陆生动物。用户没有直接说拿起章鱼或者拿起某个具体颜色的玩具而是使用一个语义类别land animal陆生动物模型需要识别场景多个动物再利用常识判断哪个生活在陆地上哪个是水生动物。然后选择正确目标。这体现的是视觉识别类别知识常识推理第二类符号理解这一类任务尤其重要因为机器人轨迹数据一般只包含拿起罐子 打开抽屉 把苹果放进碗很少包含把苹果移动到某个球队标志 把香蕉移动到某个国家国旗RT-2要依赖VLM在网络图文数据中学到的符号知识。1. Move apple to Denver Nuggets把苹果移动到丹佛掘金队的标志处。模型需要识别苹果识别多张球队标志知道哪个标志属于Denver Nuggets把标志在图像中的位置作为动作目标移动苹果过去。它体现的是名称“Denver Nuggets”↔对应的视觉标志这类球队标志知识不太可能来自有限的机器人轨迹更可能来自网络视觉语言预训练。2. Move Red Bull can to H把红牛罐移动到字母H处。模型必须在桌面上识别红牛罐字母H字母H在图像中的位置。然后把语言符号和视觉图案对应起来文字指令中的“H”↔桌面上的H形符3. Move banana to Germany把香蕉移动到德国处。这里的“Germany”并不是桌面上的文字坐标而是对应德国国旗。模型需要Germany→德国国旗的视觉外观→国旗所在位置再把香蕉移动过去。所以它展示的是从国家名称到国旗视觉符号的跨模态对应。4. Move coke can to X把可乐罐移动到字母或符号X处。模型需要在多个视觉符号中识别X并将该符号的位置转化为机器人动作目标。5. Move bag to Google把袋子移动到Google标志处。模型需要识别Google的视觉标志再把袋子移动到该标志附近。这一组任务共同说明RT-2能够把网络中学到的标志、字母、国旗等符号知识→转化为机器人动作目标论文将这类能力正式称为symbol understanding即符号理解。定量实验中还包括“把苹果移动到数字3”“把可乐罐放到心形符号上”等任务。第三类数学和语言推理Move banana to the sum of two plus one把香蕉移动到“二加一”的结果处。桌面上有不同数字符号。模型不能直接搜索文字“two plus one”而是必须先完成213213213然后找到香蕉计算答案是3在图像中识别数字3把香蕉移动到数字3处。完整过程是语言数学问题→计算结果3→视觉定位数字3→机器人移动动作这比普通的“把香蕉移动到数字3”多了一层间接推理。论文将此类任务归到reasoning类别其中还包括颜色匹配、视觉关系推理和多语言指令。不过要注意这种推理仍然较基础。论文的失败分析也指出RT-2对于需要多层间接推理的任务仍然表现较弱。第四类人物识别Move coke can to Taylor Swift把可乐罐移动到Taylor Swift的图片处。这里要求模型找到可乐罐查看多张人物图片识别哪张是Taylor Swift将人物图片位置作为目标移动可乐罐过去。这不是机器人数据中常见的物体操作标签而是来自网络视觉语言数据的人物知识。论文把这类任务称为Person Recognition人物识别定量评测中还包含把可乐罐移动到Tom Cruise处移动到Snoop Dogg处移动到戴眼镜的人处移动到白头发男性处移动到深色头发女性处。第五部分Limitation → Next PaperLimitation ①Physical Skill 仍受 robot data 限制这是最重要的。Web 数据可以告诉机器人哪个是数字 3。但是不会凭空让机器人学会擦桌子、折毛巾、使用工具。论文明确指出Web-scale pretraining没有让机器人获得新的 motionphysical skills 仍然局限于 robot data 中见过的 skill distribution。甚至 appendix 明确列出它做得不好的grasp specific object partsunseen motions比如 wiping / tool usedexterous precise motion例如 folding towel多层复杂推理那么问题自然变成既然 robot skill 上限由 robot data 决定怎么获得更多、更丰富的 robot data进而引出Open X-Embodiment实现不同实验室、不同机器人数据合起来。这个衔接特别漂亮。Limitation ②Robot Data 来自少量 embodiment 机器人本体RT-2 主要还是建立在 RT-1 那套数据上13 台类似的 mobile manipulators、office kitchen。这意味着Web Data 虽然非常广 但是 Robot Action Data 仍然非常窄于是Open X-Embodiment要回答不同 morphology、不同 action space、不同实验室的机器人数据能不能一起训练
返回列表