物理AI+ Genesis AI联创王尊玄 | 不卷大模型卷系统能力
机器人一定要长得像人吗Genesis AI 的回答是不一定。Genesis AI 这家base在法国和硅谷的具身新星今年6月推出了首款具身机器人Eno没有头和脸只保留灵巧操作必要的部分流畅简洁的设计被称为机器人界的iPhone今年四季度上市。图Genesis AI的机器人EnoEno搭载机器人基础模型GENE-26.5可以理解高层任务目标根据环境变化进行推理和规划并完成长程、多步骤任务。并且配置与中国舞肌科技联合研发的仿人灵巧手20个主动可反驱自由度尺寸与人手一一对应能够以毫米级精度完成复杂操作。Genesis AI还开发了带触觉电子皮肤的数据手套实现“人手—手套—机器人手”1∶1∶1映射采集精细动作和接触信息。Genesis AI把机器人的“大脑、双手、数据和训练环境”做成了一套完整的系统。在智元机器人与觅蜂科技联合举办的“智启具身论坛2026——迎接物理AI智能涌现”论坛上Genesis AI 联合创始人王尊玄讲解了Genesis完整的的系统观、数据观、仿真观和模型观。王尊玄麻省理工学院计算机科学与人工智能实验室MIT CSAIL 博士 Genesis AI 联合创始人曾兼任Liquid AI研究员 。其研究方向聚焦于构建能够与物理世界交互的智能体。01Genesis的系统观机器人是系统性问题王尊玄开篇定调机器人是一个系统性问题与LLM不一样不仅仅是模型的问题。过去几年大语言模型已经证明了Scaling的价值。随着数据量、算力和模型规模不断增加模型能力也在持续提升。尽管机器人不能完全照搬大语言模型的发展路线但其训练范式仍然值得借鉴。图LLM与Robotics的训练阶段对比大语言模型的训练大致可以分为三个阶段。第一阶段是大规模预训练。模型利用海量互联网数据学习语言规律以及对世界的基础认知。第二阶段是对齐。通过监督微调、人类反馈等方式模型逐渐理解用户的意图知道人类希望它完成什么任务。第三阶段是基于强化学习的后训练。模型进入代码、数学等具备明确反馈机制的环境通过大量交互获得奖励信号并逐步发展出推理和自我改进能力。Genesis AI希望为机器人构建一条相似的路径。在预训练阶段机器人可以利用第一人称视频和手套采集的人类操作数据学习人类如何与物理世界交互在对齐阶段加入少量手套数据和机器人真机数据明确模型需要完成的具体任务在后训练阶段则构建大规模仿真环境让机器人在其中反复尝试、获得反馈并更新策略。但与大语言模型相比机器人系统更加复杂。语言模型主要处理数字世界中的信息而机器人必须面对真实世界中的物体、接触、摩擦、力、形变和安全约束。模型输出的也不只是文字而是必须转化成机械手、机械臂或机器人身体可以执行的动作。因此机器人能力并不只取决于模型架构。数据采集设备是否准确、机器人硬件是否可靠、中间件是否稳定、控制系统是否及时、数据处理是否规范、评测体系是否可信都会影响最终效果。Genesis AI由此提出了一套端到端的系统方法从数据采集、硬件、中间件、控制栈、数据管线、模型训练一直观察到评测和真实部署再通过部署结果形成新的数据闭环。团队首先寻找整条链路中最关键的痛点再集中资源进行优化。这也意味着算法不一定是所有问题的答案。如果模型难以实现人类动作与机器人动作的迁移除了设计更复杂的表征学习和迁移算法也可以重新设计机械手、传感器和数据采集设备从源头降低数据与机器人本体之间的差异。02**Genesis的数据观**从人类操作中获取可扩展的灵巧数据数据是机器人实现Scaling首先要解决的问题。目前常见的机器人数据采集方式包括遥操作、UMI等手持设备、第一人称视频、互联网视频以及机器人真机采集。不同数据各有优势但很难同时满足规模、精度、物理信息和部署相关性等要求。遥操作采集的数据与目标机器人最接近但很难大规模扩展。一方面遥操作依赖机器人硬件采集成本较高另一方面操作者很难通过现有设备完整控制高自由度灵巧手。普通夹爪可能只需要控制开合但灵巧手涉及多根手指、多个关节以及复杂接触遥操作难以达到人手的精细程度。UMI或其他手持式数据采集设备具有更好的扩展性采集成本也通常低于遥操作。但它们会改变人原本的操作方式。在真实工厂或商业场景中如果要求工人先学习如何使用一套特殊设备不仅会增加培训成本也会影响原有的工作效率部分精细任务甚至无法按照原来的方式完成。第一人称视频和互联网视频拥有更大的数据规模与任务多样性。人只需要佩戴相机便可以记录大量真实操作。但纯视频数据通常缺少准确的动作轨迹、接触状态、作用力和触觉信息与机器人本体之间也存在较大差距。机器人真机数据与部署场景的相关性最高但采集成本同样最高。真机运行速度有限还会产生设备磨损、安全风险和人工维护成本因此很难获得互联网数据级别的规模。Genesis AI的选择是设计一套尽可能让人手、数据手套与机器人灵巧手相互一一对应的采集系统。工人戴上手套后仍然可以按照原来的习惯完成工作不需要为了采集数据改变操作方式。系统则在不影响生产流程的前提下被动记录人手动作、接触和触觉等信息。图Emo的灵巧手这种设计需要满足两个要求。第一是非侵入式。数据采集设备不能显著改变工人的动作习惯商业上也不增加过多培训和部署成本。只有能够进入现有工作流程数据采集才能真正扩展到工厂、厨房等真实场景。第二是数据与机器人硬件的对齐。手套、人手和最终部署的机械手需要在动作自由度、关节映射和接触信息等方面尽可能一致。手套还应具备触觉传感能力记录视觉之外的物理信息。在王尊玄看来判断一种机器人数据是否有价值不能只看数据量而需要考虑至少五个维度。首先是可扩展性即数据能否以较低成本进行大规模采集其次是多样性能否覆盖不同人员、物体、场景和任务第三是动作保真度采集到的动作能否保留人手操作的精细程度第四是物理信息数据是否包含接触、力、触觉和动力学状态第五是部署相关性即数据与最终使用的机器人和真实工作环境是否足够接近。第一人称视频在规模和多样性方面具有优势机器人数据在部署相关性方面更强而手套数据试图在规模、动作精度和物理信息之间取得平衡。图Genesis的数据组合Genesis AI希望把这些数据按照不同训练阶段进行组合利用第一人称视频和手套数据进行预训练再使用少量机器人数据完成对齐和任务微调。03Genesis的仿真观从生成训练数据转向高保真仿真评测除了数据仿真是Genesis AI系统路线中的另一个核心环节。机器人研发高度依赖评测。模型在哪些任务上失败、失败发生在哪个环节直接决定下一轮应该优化什么。但真机评测需要反复布置环境、重置物体、维护设备并组织人工操作不仅效率低也很难做到完全标准化。真实环境还存在覆盖不足的问题。一个机器人可能在实验室中完成数十次测试却无法覆盖实际部署中的物体差异、环境变化和长尾情况。对于灵巧操作而言物体位置、摩擦系数、材料、接触角度的细微变化都可能导致不同结果。强化学习对交互量的需求更大。如果把全部探索放在真机上完成训练速度、安全风险和硬件损耗都会成为限制。机器人不可能像语言模型生成文本一样低成本地进行数百万次物理试错。因此Genesis AI希望把仿真的保真度推到足以服务机器人研发的程度。这里的“高保真”并不只是画面逼真而是仿真中的物理过程和评测结果能够对应真实世界。模型在仿真中表现出的能力和缺陷应当能够反映其在真机上的表现。Genesis AI最开始是做了一个物理引擎目标是生成仿真数据去做模型训练。但在实践过程中团队逐渐把重点转向模型评测。因为仿真数据最终是否有价值仍然要看训练后的模型能否在真实世界工作。与其一开始就同时解决数据生成、模型训练和Sim-to-Real迁移不如先建立可靠的仿真评测体系验证仿真结果与现实结果的相关性把fidelity做到极致。图Genesis World 1.0 2026年5月27日发布 高保真评测一旦建立仿真便可以进一步发展为机器人的自我学习环境。机器人模型能够像Coding Agent在代码环境中工作一样与仿真环境持续交互执行动作、获得评分、更新策略再进入下一轮尝试。这样一来机器人学习就有机会从一个受制于真机数量和实验时间的问题转化成一个能够依靠算力扩展的问题。更多算力可以支持更多并行环境、更大规模的实验以及更丰富的任务覆盖。但仿真环境不能脱离真实需求。Genesis AI希望从工厂和商业部署中提取任务、设备、物体和操作流程再构建对应的仿真场景。真实部署定义问题仿真环境提供评测与训练模型能力提升后再回到真实世界验证由此形成完整闭环。04**Genesis的模型观**淡化模型架构之争走向即时部署在模型层面Genesis AI并不过度强调某一种模型架构也不把开源模型本身视为最终目标。相比模型采用什么结构团队更关注模型接收什么输入、输出什么信息以及如何吸收不同来源的数据。机器人训练面对的是异构数据互联网视频提供视觉先验第一人称数据记录人类视角下的操作过程手套数据包含精细动作和触觉信息机器人数据对应具体本体仿真数据则可以提供大规模交互与奖励信号。真正困难的是找到一套有效的训练配方将这些数据放在正确的训练阶段并解决它们在信息形式、动作空间和物理精度上的差异。从资源分配来看Genesis AI把更多精力放在数据采集、硬件对齐、数据转换和仿真环境上模型架构等纯算法研究只占相对较小的一部分。其背后的判断是机器人基础模型的竞争力不只来自某个新网络结构更来自数据、训练配方和评测体系共同构成的系统能力。Genesis AI最终追求的是“即时部署”。衡量模型价值时不能只看单项任务成功率还要看为了达到这一成功率付出了多少任务专项成本。图Genesis灵巧操作能力同样是一个小时的数据获取方式可能完全不同。一个小时的手套数据可以由工人在正常工作过程中采集而一个小时的机器人专项数据可能需要遥操作、场景重置、设备维护和大量人工配合。因此评估机器人的部署成本既要看数据时长也要看这些数据是如何获得的。Genesis AI希望通过扩大预训练数据规模不断减少新任务对专项数据和微调的依赖。当机器人进入一个新场景时不再需要为每项任务重新投入大量数据和工程资源而是能够通过零样本能力或少量数据快速适应。结语演讲的最后王尊玄再次让大家思考这个决定资源分配方式的问题Robotics究竟是一个全局问题还是一个局部问题如果机器人必须从感知、语言、推理到控制全部重新学习那么它需要覆盖完整智能体系的数据和算力。但另一种可能是机器人问题可以被分层处理。在上层任务理解、常识推理和高层规划可以借用大语言模型、多模态大模型的能力在底层机器人的重点是身体控制、物理感知、接触反馈和动作反射在两者之间则需要建立从高层意图到物理动作的映射。按照这一思路机器人公司没有必要重复构建所有通用认知能力而应把有限的数据和算力集中在物理世界特有的问题上如何控制机器人身体如何感知接触和作用力如何完成高精度灵巧操作以及如何让这些能力迁移到不同任务和场景。这也是Genesis AI系统路线的最终落点利用第一人称视频和手套数据扩大预训练规模通过机器人数据完成本体对齐通过高保真仿真进行评测与强化学习再把模型部署到工厂、厨房等真实环境中。部署中出现的问题继续产生新数据反过来推动硬件、模型和仿真迭代最终形成持续运转的数据飞轮。在机器人模型路线尚未收敛的阶段Genesis AI给出的答案并不是死磕某一种模型架构而是把数据、硬件、控制、模型、仿真、评测和部署连接成一个完整系统。机器人真正的Scaling或许不只来自更大的模型更来自这条链路中每一个环节的协同演进。图片资料来源GenesisAI官方智元机器人与觅蜂科技联合举办的“迎接物理AI智能涌现”论坛