腾讯机器人X团队打造“会思考也会想象“的机器人大脑——RxBrain
这项由腾讯机器人X团队、富田实验室与腾讯混元团队联合发布的研究于2026年7月15日以预印本形式公开论文编号为arXiv:2607.14187。感兴趣的读者可以通过该编号在arXiv平台查阅完整论文。**研究概要**教一个机器人完成任务远比教一个孩子学骑自行车难得多。孩子看几次示范就能理解要向前踏、要保持平衡而机器人往往需要被明确告知每一个步骤甚至需要提前想象自己完成任务之后周围世界会变成什么样子。这种既能规划步骤、又能在脑海中预见结果的能力正是人类与目前大多数机器人之间最本质的差距之一。腾讯这支联合团队提出了一个名为**Hy-Embodied-RxBrain**简称RxBrain的具身认知基础模型目标是让机器人在制定行动计划时不仅能用语言描述第一步做什么、第二步做什么还能同时在脑海中生成每一步执行完成后世界应该是什么样子的画面——就像一个有经验的厨师不仅知道菜谱上写着先把洋葱炒软还能在动手之前就清晰地预见到锅里金黄透明的洋葱应该呈现出什么状态。这项研究的核心突破在于它是业界首次将语言推理与视觉想象真正耦合在同一个规划序列中的具身认知模型而非让两者分别工作后再拼合结果。---**一、为什么机器人既要说也要想**现有的机器人智能系统大致分成两个阵营。一类是视觉语言模型它们擅长理解眼前的画面、听懂人类指令、分解任务步骤能用语言告诉机器人先拿起杯子再把杯子放到托盘上。这类模型的短板是它们描述计划时完全停留在语言层面对于拿起杯子之后世界应该长什么样缺乏明确的视觉预见就像一个从未下过厨房的人照着菜谱念步骤却没见过食物完成时应有的样子。另一类是生成式世界模型它们善于预测动作执行后的画面能生成机器手臂伸过去抓住杯子后的视频片段。但这类模型通常不擅长进行因果推理、理解约束条件或进行长程的逻辑规划更像是一台擅长渲染画面的摄影机却没有导演的脚本意识。RxBrain的思路是让语言和视觉像乐队里的指挥和乐手一样配合工作。语言负责告诉机器人整首曲子的结构——哪一段先演奏、哪里要停顿、整体节奏是什么视觉想象则负责把每一段旋律奏出来让抽象的乐谱变成实实在在的声音。在RxBrain的规划序列中语言描述行动步骤、约束条件和决策逻辑而视觉想象则为每一个步骤生成对应的世界状态图——执行完这步之后眼前的场景应该是什么样子。两者互为补充缺一不可。---**二、RxBrain的大脑结构是怎么搭建的**RxBrain建立在一种叫做**混合变换器架构**Mixture-of-Transformers简称MoT的技术框架上。普通读者可以把这个架构理解为一座分工明确的大型办公楼楼里有专门处理文字的部门、专门理解图片的部门、专门生成图片的部门但这三个部门共享同一套会议室——也就是说不同部门之间可以充分交流信息但各自的专业工作又不会相互干扰。具体来说RxBrain包含三类主要工作单元。语言变换器负责处理所有文字包括理解人类指令和生成规划步骤的文字描述视觉变换器负责理解输入的图像和视频理解和生成的视觉内容共享同一套注意力机制可以理解为它们看同一套信息但用不同的方式处理同时各自有独立的前馈网络相当于各自的专属处理流水线此外还有一个专门负责视觉生成的模块它的处理容量特意做得更大——中间层宽度从6144扩展到12288——因为凭空生成一张有意义的画面比理解一张已有的画面更具挑战性。整个模型共有62亿个参数其中语言理解和视觉理解各约15亿视觉生成模块约24亿其余分布在共享模块和外围组件中。视觉内容的生成采用了来自FLUX模型的冻结VAE变分自动编码器作为图像的编码和解码工具可以理解为一个专业的图像压缩与还原机器负责在模型内部表示和最终输出图像之间架桥。为了让模型在生成规划序列时既能保持因果逻辑先发生的影响后发生的又能让同一张图片内部的信息充分交流RxBrain设计了一套混合注意力机制处理文字时用因果注意力只看之前的内容处理图片时在每张图片内部用双向注意力图片内所有位置互相参考跨图片之间仍保持因果顺序。这就像一本故事书同一页内的插图细节可以互相对照但后面的页面不能剧透前面的内容。---**三、RxBrain如何生成文字画面交织的计划**RxBrain支持三种输出模式对应具身任务中的不同需求。第一种是纯文字生成模式用于回答关于当前场景的问题或输出语言形式的规划步骤。机器人看到眼前的场景后通过标准的逐词生成方式输出文字答案或行动指令。第二种是多帧视频预测模式用于预测执行某个动作后接下来四帧画面会是什么样子。这四帧画面并行生成而非一帧一帧串行大幅提升效率同时帧间保持因果顺序也就是越后面的帧可以参考越早的帧但不能看到未来。这就像同时制作四格漫画的四个格子每个格子的画师都能看到前面格子已经画好的内容但不能偷看后面格子。第三种是交错生成模式这也是RxBrain最核心的能力所在。在这种模式下模型输出的是一个语言与图像交替出现的完整规划序列先生成第一步的文字描述再生成对应的目标状态图像然后把这张生成的图像重新看一遍作为上下文输入再生成第二步的文字再生成第二步的画面……如此循环直到任务完成。关键的设计细节在于在训练时模型看到的上一步生成的图像不是直接拿来的原图而是经过了生成→解码→重新编码这一完整流程处理过的图像。这么做是为了让训练时和真正推理时的体验尽量一致——因为在实际使用时上一步的图像确实是模型自己生成的而不是来自真实世界的照片。这个细节减少了训练和推理之间的期望差距让交错生成的质量更加稳定。---**四、用五万小时视频训练出计划感**要让RxBrain学会这种语言加视觉的联合规划能力需要大量带有每一步动作配对对应状态变化画面的训练数据。然而现有的数据集几乎没有这种格式——大多数机器人数据只有动作指令或只有连续视频没有把两者精确对齐起来。为此研究团队设计了一套全自动的数据构建流水线把原始具身任务视频转化为文字画面配对的联合规划训练样本。原始视频数据来自四大类来源真实机器人操作数据约17292小时、UMI手持夹持器采集数据约17506小时、仿真环境数据约1317小时、以及第一人称人类日常操作视频约14062小时。总计超过5万小时包含约2150万个可用片段通过约2861万个候选片段筛选而来通过率约75%。这条流水线分三个阶段。第一阶段是时序片段标注系统先对视频进行关键帧采样——不是均匀采样而是优先选取画面变化最明显的时刻就像一本菜谱只需要在每道工序最关键的时刻拍一张照片而不是每秒都拍。采样完成后用一个多模态大语言模型对视频进行整体理解提出候选动作步骤列表每个步骤包含一个简短名称、详细描述以及在关键帧序列中对应的粗略起止位置。随后系统在粗略范围附近密集采样用模型精确定位每个步骤的真实开始帧和结束帧。第二阶段是质量验证对每一个标注出来的片段系统自动检查它是否符合高质量训练样本的标准。检查项涵盖三大类语义质量这个片段是否只包含一个清晰的原子动作操作目标是否清晰可见画面是否有水印遮挡文字描述是否准确匹配画面动作是否真实发生两帧锚点是否都可读、视觉接地性手或夹持器是否可见机器手臂是否可见目标物体是否有意外消失、以及一致性两帧是否在同一场景相机视角是否稳定画面朝向是否正常描述与视觉变化是否一致手的变化是否在文字中有所体现。如果画面变化有效但文字描述有误系统会自动修正文字而不是直接丢弃这个片段。最终约75%的候选片段通过了质量验证。第三阶段是片段结构化把通过质量验证的片段组织成四个层级的训练任务。最基础的L0层是单步预测输入一步的起始画面和动作描述预测这步结束时的画面L1层是步骤级联合规划给定视觉上下文和目标条件模型输出一系列步骤文字及其对应的结束画面L2层是子目标规划把若干步骤合并为更高层次的子目标每个子目标配有边界画面L3层是最终状态想象只给初始画面和任务描述让模型直接预测整个任务完成时的最终画面。这四个层级从局部到全局让模型学会在不同粒度上进行联合规划。---**五、分两阶段训练先打基础再专攻具身**RxBrain的训练采用两阶段课程式策略可以类比为先上通识课、再上专业课。第一阶段是联合视觉语言预训练训练数据由两大部分混合而成60%是大规模图文对来自LAION和COYO数据集共约2亿条40%是多模态指令跟随数据来自LLaVA-OneVision和MAmmoTH共约1.13亿条。这一阶段的核心目标是让模型同时学会理解图像和生成图像在一个共享的表示空间中把语言、视觉感知和视觉生成统一起来同时保留大语言模型原有的语言能力。图像生成目标损失权重设置相对更高λ1.0语言生成权重相对较低λ0.25这是因为视觉生成能力需要从头建立而语言能力已有良好基础。第二阶段是具身监督微调从第一阶段的检查点继续训练训练数据混合了六类内容总计约422份的混合比例一般图文对T2I基础数据和高质量图文对合计约25.9%、通用多模态理解数据34.6%、具身多帧世界模型数据16.2%、具身交错规划数据20.8%。这一阶段两类损失权重相等均为1.0让语言推理和视觉生成在具身任务上协同提升。训练时使用了最高368块GPU即46个8卡节点全局批量大小7360第二阶段使用312块GPU39个节点全局批量3120。两阶段均使用AdamW优化器、余弦学习率调度和bf16精度图像生成分辨率上限256像素通过16倍下采样的VAE进行潜变量操作。---**六、RxBrain-Bench专门评测联合规划能力的新基准**为了衡量模型是否真正掌握了语言视觉联合规划的能力研究团队专门构建了一个新的评测基准**RxBrain-Bench**。这个基准分三个评测赛道。第一个赛道叫具身视觉问答EVQA评测模型能否从视觉观察中理解具身场景并作出任务相关的决策。题目来自工业、零售和服务等真实商业场景涵盖高层规划把任务分解为可执行步骤、模拟推进规划在多轮交互中根据中间状态更新后续决策、细粒度步骤推理抓取点、运动轨迹、动作选择、时序判断、多视角观察、错误恢复识别异常状态并选择正确应对方式、以及任务完成判断判断当前状态是否满足目标。共1123道多选题加258道模拟规划题总计1381个评测项目。第二个赛道叫世界状态预测WorldPred评测模型在给定当前观察和自然语言动作指令后能否生成描述动作结果的短时序画面4帧。评测标准包含五个维度观察连续性生成的第一帧是否自然延续当前观察、动作正确性生成的帧序列是否执行了正确的动作、目标完成度最终帧是否达到了任务暗示的目标状态、时序物理合理性帧间运动是否流畅且物理上合理、以及与真实轨迹的匹配度最终加权得分为这五项的线性组合。第三个赛道叫联合规划JointPlan也是RxBrain-Bench最核心的部分评测模型能否在完全自回归的闭环推演中进行语言加视觉的联合规划。模型在每一步都必须输出自然语言子步骤描述和对应的目标画面然后以自己生成的画面作为下一步的输入继续规划直到任务完成。评测标准包含六个维度观察理解、子任务规划、目标图像正确性、子任务与目标的一致性、完整链条的完成度、以及图像相似度用DINO特征的余弦相似度衡量生成画面与真实目标画面的接近程度加权得分覆盖这六个方面。---**七、评测结果在多个维度上表现出色**在通用图像生成能力方面RxBrain在GenEval基准上获得82.4分与专门针对图像生成优化的BAGEL模型82分基本持平明显高于同样具备生成能力的Cosmos-3-Nano模型71.68分。这说明RxBrain在扩展到具身任务的同时并没有牺牲其通用图像生成能力。在具身与空间理解方面RxBrain在多个公开基准上处于前列。在CV-Bench上以88.59分排名第一在EmbSpatial上以82.3分紧追Cosmos-3-Nano82.1分的第二位在DA-2k深度感知理解上以83.4分排名第一。特别在多视角和三维理解领域RxBrain的优势最为突出在3DRSBench上以54.1分排名第一在MMSI-Bench多图空间智能上以35.8分领先在MindCube空间心理建模上以47.5分名列前茅在SITE-Bench图像空间理解上以54.9分居首。在机器人轨迹预测上Share-Robot-TrajectoryRxBrain以51.13分排名第一比此前最佳模型Cosmos-3-Nano的39.02分高出约12个百分点。在RoboSpatial-Home配置理解上以86.28分排名第一。不过在需要精确指点定位Pointing和机器人抓取位置预测Share-Robot-Affordance方面专门针对空间指向优化的RoboBrain2.5模型仍然更强。在RxBrain-Bench-EVQA的自建评测中RxBrain综合得分为72.7分低于Qwen3.5-4B的78.1分和Cosmos-3-Nano的76.7分但在成功检测Success Detection85.1分和模拟规划Simulation Planning51.6分两个维度上表现最佳说明模型在判断任务是否完成以及在多轮模拟中更新决策方面有独特优势。主要差距集中在精细空间定位、轨迹与时序推理以及错误恢复方面。在世界状态预测WorldPred评测中RxBrain以0.62的综合得分超越Cosmos-3-Nano0.591和Wan2.2-TI2V-5B0.429。观察连续性得分0.67和动作正确性得分0.65是最强项时序物理合理性0.53是最弱项说明生成画面的物理连贯性仍有提升空间。在不同子数据集上的表现从UMI的0.73到arctic的0.35不等两帧条件输入的整体效果最佳。值得关注的是RxBrain虽然并非专门的视频生成模型却超过了专为具身世界建模设计且在大量视频数据上预训练的Cosmos-3-Nano体现了统一模型架构的优势。在联合规划JointPlan评测中RxBrain以0.68的综合得分大幅领先所有基线Cosmos-3-Nano智能体得分0.521统一多模态模型BAGEL-7B-MoT得分0.503模块化的Qwen-Agent得分0.431。具体来看观察理解得分0.83和子任务规划得分0.78是最强项目标图像正确性0.52是最弱项再次印证了语言推理能力强于视觉想象能力的规律。在不同规划深度上两步规划得分0.69八步规划得分降至0.55体现了长程推演中误差累积的挑战。RxBrain在子任务规划和链条完成度上的领先优势最大说明它在保持整体计划一致性方面具有明显优势。---**八、从大脑到手臂扩展到真实机器人动作生成**RxBrain不只是一个能规划的大脑研究团队还把它扩展成能控制机器人手臂实际运动的系统。扩展的方式是在原有的MoT架构基础上新增一个动作专属分支包含独立的注意力投影层、前馈网络和层归一化但仍与语言、视觉和状态的全局注意力共享信息交流。这个动作分支的初始参数复制自视觉理解分支相当于让它从理解画面的能力出发重新学习如何把理解转化为动作。一个特别设计的门控专家融合机制让动作分支能够借用视觉生成分支中已经学到的预测性和规划性知识。具体来说动作模块的前馈网络输出等于动作专属前馈网络的结果加上一个可学习的通道门控权重乘以视觉生成前馈网络的结果。这个门控权重初始为零意味着训练开始时动作模块完全依靠自身随着训练推进门控权重逐渐学习到哪些视觉生成知识对动作预测有帮助并选择性地引入。这种设计让动作模块不需要从零开始学习规划性知识而是站在视觉生成模块已有积累的肩膀上。动作的表示方式是对于双臂机器人每个机械手臂的末端执行器状态包含三维位置、四元数姿态和夹持器开合量共16维。本体感知状态通过轻量级编码器映射为单一状态令牌未来H步的动作块通过流匹配Flow Matching在归一化动作空间中生成训练目标是让模型预测的速度场在去噪过程中准确指向真实动作方向。在真实机器人实验中研究团队选取了三个多阶段家务操作任务进行评测每个任务各进行100次真机试验。在摆设餐桌任务中需要从架子上取出盘子、叉子和刀并按正确位置摆放RxBrain成功率97%超过π0的82%和π0.5的90%。在折叠收纳眼镜任务中需要折叠眼镜腿并放入眼镜盒RxBrain成功率95%超过π0的76%和π0.5的82%。在捡拾垃圾任务中需要先开垃圾桶盖再将废纸放入RxBrain成功率68%超过π0的46%但略低于π0.5的74%。三个任务的平均成功率为87%π0为68%π0.5为82%。需要特别指出的是这些结果是在没有大规模动作数据预训练的情况下取得的说明具身规划预训练产生的世界知识确实能够迁移到真实动作控制中。---**九、让推理速度跟上机器人的手速**在实验室里表现优秀的模型在真正控制机器人时还面临一个重要挑战速度。如果模型每次预测动作都需要很长时间机器人就会动得磕磕绊绊就像一个总是犹豫半天才迈腿的人走路一样。研究团队对实时部署进行了专项加速优化并坚守一个底线所有优化必须在数值上等价于原始模型也就是说机器人的轨迹不能因为加速而发生任何可测量的变化。原始模型每帧推理需要210毫秒主要瓶颈出乎意料地不是矩阵乘法而是混合变换器架构中的模态分发逻辑每一层都要重新计算哪些令牌属于语言、哪些属于视觉、哪些属于动作这个操作在一次前向传播中触发了约1091次nonzero调用累计占据174毫秒CPU时间再加上索引操作的48毫秒和拷贝操作的21毫秒。针对这个瓶颈研究团队实施了三项优化预计算前缀键值缓存观察帧和指令文字的上下文在动作流匹配的多步去噪过程中是固定不变的可以只计算一次并复用仅对动作令牌进行快速解码有了缓存之后每步去噪只需要处理16个动作令牌而非989个前缀令牌加16个动作令牌去同步化模态分发加CUDA图捕获把每层的令牌路由索引预计算好用gather和scatter替换布尔索引消除GPU与CPU之间的反复同步最后用CUDA图固定整个解码步骤以消除内核启动开销。三项优化组合后推理延迟从210毫秒降至143毫秒提速约1.47倍同时位置误差小于0.65毫米、姿态误差小于0.73度完全处于bf16精度的舍入误差范围内。---**研究的局限与未来方向**研究团队坦诚地指出了RxBrain目前存在的三个主要局限。第一模型规模相对较小62亿参数可能限制了它处理高度复杂推理、精细视觉想象和长程规划的能力扩大模型和数据规模是显然的改进方向。第二虽然RxBrain能跨多种具身场景泛化但对于完全陌生的环境、机器人形态或任务领域仍然需要额外的微调才能达到理想性能。第三交错生成涉及两种不同的生成范式文字的自回归生成和图像的流匹配生成训练和推理之间仍然存在一些差异尽管通过VAE重建传递的视觉状态构建策略已经有所缓解但尚未引入强化学习或其他序列级优化方法来进一步对齐两种模态的生成过程。未来团队计划向两个方向发力一是扩大模型规模预期更大的模型将在联合规划的连贯性、世界状态预测的准确性和整体规划能力上带来系统性提升二是增强自主性让模型更好地分解开放性任务、监控执行进度、修正规划并以更自主的方式与环境交互。---说到底RxBrain这项工作的意义在于它清晰地回答了一个问题一个能真正胜任复杂任务的机器人大脑需要的不仅仅是会说第一步做什么也需要能在脑海中看见每一步完成后世界应该是什么样子这两种能力必须紧密耦合而不是各自为政。RxBrain给出了一套初步但系统的实现方案——从模型架构、数据构建、训练策略到评测体系——为具身认知基础模型的研究开辟了一条有价值的路径。对这项研究感兴趣的读者可以通过arXiv编号2607.14187找到完整论文也可以在Hugging Face上查找Tencent/Hy-Embodied-RxBrain-1.0获取模型在GitHub上查找Tencent-Hunyuan/Hy-Embodied-RxBrain-1.0获取代码。---**QA**Q1RxBrain和普通机器人规划模型有什么区别A普通机器人规划模型要么只用语言描述步骤要么只生成画面两者分开工作。RxBrain的特点是把语言步骤规划和视觉状态想象放在同一个序列里同时完成——每说出一个动作步骤就同时生成那步执行后世界应该是什么样子的画面两者互相验证、互相依赖。Q2RxBrain真实机器人测试的成功率是多少A在三个家务操作任务上RxBrain平均成功率为87%摆设餐桌97%折叠收纳眼镜95%捡拾垃圾68%。对比基线π0平均68%和π0.5平均82%RxBrain整体更优且是在没有大规模动作数据预训练的条件下取得的。Q3RxBrain的训练数据有多大规模A研究团队从真实机器人操作、手持夹持器采集、仿真环境和人类第一视角视频四类来源收集了超过5万小时的具身任务视频通过自动化流水线筛选出约2150万个高质量训练片段通过率约75%。