
2026具身智能模型选型全攻略π0.5、GR00T N1.6、OpenVLA、GO-1 真实对比微调实战文章目录2026具身智能模型选型全攻略π0.5、GR00T N1.6、OpenVLA、GO-1 真实对比微调实战一、先搞懂 VLA机器人的大脑长什么样二、六大主流模型逐个看2.1 π0.5第一个在陌生家庭里干活的模型2.2 GR00T N1 → N1.6英伟达的打法是生态2.3 OpenVLA用得最多的开源基线2.4 GO-1会看人类视频学动作的大脑2.5 Helix 和 Gemini Robotics闭源阵营2.6 国产开源新势力2026 年这波三、真实基准对比数字说话四、选型速查别问谁最强问你要干什么五、实操GR00T N1.5 微调全流程SO-101 Jetson Thor5.1 环境准备5.2 数据采集与格式转换5.3 开始微调5.4 先验证再上真机5.5 替代方案OpenVLA LoRA单卡快速验证六、四个常见坑都是真实踩过的七、趋势判断世界模型正在杀回来八、参考资料做个机械臂的具身智能 demoGR00T、OpenVLA、π0.5 到底该用哪个官网上每个模型都写着通用“强大”“开源”真到自己动手不知道哪个适合自己的场景。本文详细汇总整理把主流模型的论文、技术报告和开源仓库等内容又对照GR00T 的微调流程的官方教程。这篇文章把结果都写出来每个模型强在哪、真实基准数据长什么样、上手要踩哪些坑。所有数据都有公开出处不编。一、先搞懂 VLA机器人的大脑长什么样现在具身智能的主流方案叫 VLAVision-Language-Action视觉-语言-动作模型。工作原理一句话就能说清输入是摄像头画面加一句自然语言指令输出直接是机器人的关节控制命令。以前的机器人是感知→规划→控制三段式各做各的中间靠接口对接误差层层累积。VLA 把这条链路压成一个端到端模型你说把桌上那个红色杯子递给我它自己看、自己想、自己动。顺便交代一下行业背景方便理解后面各家模型的定位。2025 年全球人形机器人出货约 1.7 万台中国占比超过八成——硬件量产我们确实跑在前面。但前沿的基础模型目前还是海外实验室声量更大π0.5、Gemini Robotics、GR00T 都是。简单说就是身体看中国大脑看开源社区选型这件事因此格外重要。二、六大主流模型逐个看先看总览表后面逐个拆。模型机构时间参数规模开源架构特点π0.5Physical Intelligence2025.042025.09 开源VLM骨干动作专家是openpiFlow Matching 连续动作GR00T N1.6NVIDIA2025.123B是双系统VLMDiTOpenVLA / OFT斯坦福、伯克利等2024.06 / 2025.027B是自回归离散动作GO-1智元机器人2025.03VLM约2BMoE是ViLLA隐空间规划器HelixFigure AI2025.02S2约7B S1约80M否双系统慢思考快反射Gemini Robotics ER 1.5Google DeepMind2025-2026未公开否基于 Gemini 多模态2.1 π0.5第一个在陌生家庭里干活的模型π0.5 最硬的卖点不是某个指标而是一个事实它能在训练数据里从没出现过的新家庭里完成打扫厨房整理卧室这种多阶段长任务。前代 π0 做不到这一点演示基本局限在接近训练环境的场景里。做法是异构数据协同训练除了自家机器人数据还混入其他机器人包括单臂、固定底座的的数据、互联网图文数据、高层子任务预测和口头指令数据。训练分两阶段先做宽口径预训练让模型理解世界和任务结构再做后训练聚焦移动操作本身。动作生成用的是 flow matching 连续动作比离散 token 更平滑适合高频控制。π 系列的时间线值得记一下π02024.10证明 VLM 能驱动灵巧操作→ π0-FAST2025.02FAST 分词器让训练提速 5 倍→ π0.52025.04开放世界泛化→ π-ego2025.12人类第一视角视频迁移研究。2025 年 9 月π0.5 的代码和权重在 openpi 仓库开源LeRobot 也已集成 Pi05 策略普通开发者终于能跑起来了。2.2 GR00T N1 → N1.6英伟达的打法是生态GR00T N1 于 2025 年 3 月发布2B 参数架构是双系统System 2 是 VLM负责慢速理解语言和场景System 1 是 Diffusion Transformer专职高频实时生成动作两者端到端联合训练。英伟达在训练资源上很舍得投入据论文和公开报道训练用了 1024 块 GPU、约 5 万 H100 GPU 时。后面两个版本各有侧重N1.52025.063B 参数改进了 VLM 与 DiT 之间的连接模块语言跟随能力大幅跃升——GR-1 人形机器人的操作任务上语言指令成功率从 N1 的 46.6% 涨到 93.3%。这个差距很能说明问题N1 经常听不懂你在说什么N1.5 基本能照办了。N1.62025.12在双臂操作和 loco-manipulation边走边操作的全身任务上继续提升跨本体支持更好。不过英伟达真正的护城河不是模型本身而是配套工具链Isaac GR00T 仓库管微调Isaac Lab 管仿真Jetson Thor 开发板管端侧部署模型还兼容 LeRobot 数据格式。社区教程也全Seeed 那篇 SO-101 机械臂的教程一天就能走通采集→微调→部署全流程。对预算有限的团队这是目前工程上最顺的一条路。2.3 OpenVLA用得最多的开源基线OpenVLA 是 7B 参数的自回归 VLA动作离散成 token 输出在 Open X-Embodiment 的 97 万条真机轨迹上训练代码权重全开源。它的价值不在于最强而在于被研究得最透、复现的人最多——你想验证一个新想法拿它做对比最省事。原版有两个实际短板自回归解码慢推理只有个位数 Hz高频控制不够用动作离散化有精度损失。2025 年 2 月团队跟进的OpenVLA-OFT把这两个问题一起修了效果相当猛LIBERO 仿真基准平均成功率从 76.5% 拉到97.1%动作生成吞吐量提升 26 倍真机 ALOHA 双臂 4 个任务平均成功率87.8%超过 π077.1%、RDT-1B78.4%、ACT72.3%和 Diffusion Policy77.5%。OFT 的关键是三件事并行解码、动作分块一次前向输出未来一串动作、连续动作 L1 回归替代离散 token。这三招自己微调时可以直接抄第五节会讲。2.4 GO-1会看人类视频学动作的大脑智元机器人 2025 年 3 月发布 GO-1架构叫 ViLLAVision-Language-Latent-Action约 2B 参数的 VLM 负责理解MoE 里的 Latent Planner 靠海量跨本体数据和人类操作视频学通用动作理解Action Expert 靠百万级真机数据学精细执行。亮点有两个。一是能从互联网视频和人类示范里学习新任务少样本甚至零样本就能泛化后训练成本压得很低二是一脑多形同一套策略能迁移到不同机器人本体。GO-1 已开源兼容 LeRobot 数据格式配合 Genie Studio 平台可以做采集、微调、部署一条龙。用智元本体的团队它是首选。2.5 Helix 和 Gemini Robotics闭源阵营Figure 的 Helix2025.02是双系统架构的开创者System 2 是约 7B 的 VLM低频负责场景和语言理解System 1 是约 80M 参数的轻量策略以 200Hz 高频把理解结果翻译成电机指令。GR00T N1 后来用了类似设计说 Helix 影响了整个行业的技术走向不夸张。但它闭源只跑在 Figure 自家机器人上。Google DeepMind 的 Gemini Robotics 系列同样闭源基于 Gemini 多模态大模型最新的 ER 1.5 主打先思后行——先推理规划再执行动作。普通开发者拿不到也微调不了它更多是行业的技术风向标。2.6 国产开源新势力2026 年这波最近几个月国产具身模型密集开源几个值得关注的达摩院 RynnBrain2026.02 开源具身大脑基模主打时空记忆和空间推理官方称在 16 项具身开源评测榜单刷新纪录SOTA超过 Gemini Robotics ER 1.5 和 NVIDIA Cosmos-Reason2。注意它的定位是大脑——负责理解和规划动作执行要接下游策略。Xiaomi-Robotics-0小米开源的 47 亿参数 VLA兼顾视觉语言理解和实时执行。StarVLA港科大与社区2026.05统一 PyTorch VLA 框架不做任何数据增强、只用基准原始数据和公开预训练权重LIBERO 上 30K 步就做到 98.8% 成功率。三、真实基准对比数字说话三组可以直接对比的数据。表 1LIBERO 仿真基准平均成功率模型平均成功率备注OpenVLA原版全参微调76.5%基线OpenVLA-OFT97.1%并行解码动作分块连续动作StarVLA98.8%30K 步无数据增强表 2ALOHA 双臂真机任务平均成功率出自 OFT 论文模型平均成功率OpenVLA-OFT87.8%RDT-1B78.4%Diffusion Policy77.5%π077.1%ACT72.3%表 3GR-1 人形机器人语言跟随测试模型语言指令成功率GR00T N146.6%GR00T N1.593.3%有一组数字我没放进表里π0.5 的家庭环境评测。它的考核方式是在完全陌生的家庭完成长程任务和 LIBERO 不是一套基准数字没法直接比。但这恰恰是我想强调的仿真分高不等于真机能跑。LIBERO 榜单已经卷到接近满分可 2026 年行业在真机泛化、长程任务、接触丰富场景上集体撞墙——这也是世界模型重新火起来的原因第七节细说。四、选型速查别问谁最强问你要干什么你的情况推荐模型理由没有真机纯仿真研究OpenVLA / StarVLALIBERO、SimplerEnv 基准成熟好复现SO-101 等轻量臂预算有限GR00T N1.5 / N1.625GB 显存可微调Jetson Thor 部署教程全单张 3090/4090 想快速验证OpenVLA LoRA消费级显卡友好可 4bit 量化推理人形 / 双臂复杂操作GR00T N1.6、GO-1N1.6 专攻双臂与全身操作GO-1 配智元本体家庭场景要跨环境泛化π0.5目前唯一做过陌生家庭验证的开源模型数据很少想用人类视频学GO-1ViLLA 架构原生支持人类视频学习商业闭源整体方案Helix、Gemini Robotics只随合作方产品提供说句实在话如果你连真机都还没有先别纠结选模型把 LIBERO 基准跑一遍对各模型的能力边界有体感再说。五、实操GR00T N1.5 微调全流程SO-101 Jetson Thor下面走一遍完整流程案例来自 Seeed Studio 官方 wiki我补了每一步容易踩的坑。目标在 LeRobot SO-101 机械臂上微调 GR00T N1.5部署到 Jetson Thor。5.1 环境准备需要一台带 GPU 的 x86 机器做微调显存 25GB 起架构必须 Ampere 及以上一台 Jetson AGX Thor 做端侧部署。# 微调机克隆仓库并装依赖sudoaptinstallgit-lfsgitlfsinstallgitclone --recurse-submodules https://github.com/NVIDIA/Isaac-GR00TcdIsaac-GR00Tsudoapt-getupdatesudoapt-getinstall-yffmpeg# 官方推荐用 uv 管理环境Python 3.10uvsync--python3.10# 进入 SO-100/SO-101 示例目录cdexamples/SO100/ uv pipinstall-e.5.2 数据采集与格式转换采集用 LeRobot 的遥操作流程单任务采 50 条左右轨迹就能微调。这里有个大坑新版 LeRobot 采集出来的数据是 v3.0 格式GR00T 需要 v2.0直接喂会报错先用官方转换脚本转一遍详见第六节坑 1。# 采集完成后的数据集结构LeRobot 格式data/ ├── meta/# episodes.jsonl、tasks.jsonl 等元信息├── videos/# 多视角视频└── parquet/# 每帧的状态与动作# v3.0 → v2.0 转换脚本路径以仓库 README 为准python scripts/convert_lerobot_v3_to_v2.py\--input./data\--output./data_v25.3 开始微调python scripts/gr00t_finetune.py\--model-id nvidia/GR00T-N1.5-3B\--data-path ./data_v2\--data-config so100_dualcam\--video-backend torchvision_av\--modality-config modality.json# 参数说明# model-id 官方 3B 预训练权重#># modality-config 机器人状态/动作维度映射几个注意点默认配置约需25GB 显存不够就在 gr00t_finetune.py 里调小 batch size自己的机器人不是 SO-101 的话改 modality.json声明你的状态/动作维度本地没卡可以用 NVIDIA Brev 云端微调权重拉回 Thor 部署即可。5.4 先验证再上真机训练完成后先做开环验证把采集数据回放给模型看预测动作轨迹是否贴合示范确认收敛了再谈上机。真机部署用 ZMQ 的 Server-Client 架构推理端Model Server跑在 Thor 或工作站只负责模型前向控制端Local Client跑在机械臂上位机负责读传感器、发指令两端解耦改哪边都不影响另一边。最小骨架长这样importzmq# ---------- 推理端 Model ServerJetson Thor / 工作站 ----------ctxzmq.Context()sockctx.socket(zmq.REP)sock.bind(tcp://*:5555)# 等待控制端连接whileTrue:obssock.recv_json()# 收观测图像 关节状态 语言指令actionmodel.predict(obs)# 模型前向输出动作块sock.send_json(action.tolist())# 回传给控制端# ---------- 控制端 Local Client机械臂上位机 ----------ctxzmq.Context()sockctx.socket(zmq.REQ)sock.connect(tcp://SERVER_IP:5555)# 指向推理端地址sock.send_json({image:frame,state:joints,task:pick up the red cup})actionsock.recv_json()# 按控制频率下发执行两端各跑各的进程推理慢了控制端可以加缓冲控制端换了推理端不用动调试时也能各自看日志。5.5 替代方案OpenVLA LoRA单卡快速验证不想装 Isaac 全家桶的话OpenVLA 更轻。官方放出了 LIBERO 四个套件的 LoRA 微调检查点r32自己微调也不挑卡fromopenvla.modelsimportOpenVLAfrompeftimportLoraConfig# 加载 7B 预训练模型4bit 量化省显存vlaOpenVLA.from_pretrained(openvla/openvla-7b,load_in_4bitTrue,)# LoRA 配置官方配方 r32只注入 attention 层loraLoraConfig(r32,lora_alpha64,target_modules[q_proj,v_proj],lora_dropout0.0,)vla.add_adapter(lora)# 训练时学习率别大2e-5 量级起步# 训完可直接 4bit 量化推理消费级显卡也能部署如果你的任务需要高频控制双臂 25-50Hz记得把 OFT 的三件套安排上并行解码、动作分块、连续动作 L1 回归。不然原版自回归解码一步要等几百毫秒机械臂会肉眼可见地一顿一顿。六、四个常见坑都是真实踩过的坑 1LeRobot v3.0 数据直接喂 GR00T加载报错现象数据集加载时抛异常、字段解析失败。原因GR00T 按 LeRobot v2.0 格式读数据新版遥操作采集默认输出 v3.0。解决跑一遍 Isaac-GR00T 仓库提供的转换脚本5.2 节转完再微调。坑 2云端微调报 “GPU not supported”现象在 V100、T4 这类卡上微调直接失败。原因GR00T 微调要求 Ampere 及以上架构30/A 系列。解决换 A100、A6000、3090/4090租用 GPU 时看清架构再下单。坑 3跳过开环验证直接上真机现象机械臂乱动一下午白搭。原因训练没收敛或数据有问题闭环测试根本看不出原因在哪。解决先做开环回放预测动作曲线贴着示范走了再上真机。NVIDIA 官方部署指南也是这个顺序别跳步。坑 4OpenVLA 原版跑高频任务一卡一卡的现象双臂任务卡顿、成功率暴跌。原因自回归解码一次前向才出一个动作撑不起 25-50Hz 的控制频率。解决上 OpenVLA-OFT 的并行解码动作分块官方数据吞吐量提升 26 倍。七、趋势判断世界模型正在杀回来最后聊点趋势。2026 年行业开始冷静反思 VLA端到端模型强则强矣但它并不真正理解我这么做之后世界会怎样。于是世界模型重新走热——Meta 的 V-JEPA-2、DeepMind 的 Genie、Wayve 的 GAIA、1X 的 World Model都在做同一件事让模型先在想象里推演动作的后果再决定怎么做。ICLR 2026 上的 WMPO 干脆提出在想象中做强化学习Physical Intelligence 的 π-ego 则证明了人类第一视角视频可以迁移给机器人给低成本数据开了个口子。我的判断VLA 不会被世界模型取代两者会合流——一个管怎么做一个管做了会怎样。眼下选型VLA 仍是最稳的落地起点但世界模型的仓库值得点个 star那是下一波浪潮的方向。八、参考资料GR00T N1 论文https://arxiv.org/abs/2503.14734GR00T N1.5 / N1.6 官方页面https://research.nvidia.com/labs/gear/gr00t-n1_6/π0.5 论文https://arxiv.org/abs/2504.16054OpenVLA-OFT 论文https://arxiv.org/abs/2502.19645GR00T 微调部署实操Seeed Wikihttps://wiki.seeedstudio.com/fine_tune_gr00t_n1.5_for_lerobot_so_arm_and_deploy_on_jetson_thor/GR00T 真机部署指南NVIDIA 技术博客https://developer.nvidia.cn/blog/groot-real-machine-deployment/本文数据均来自公开论文、官方技术页面与权威媒体报道数字有出处可查发现错漏欢迎评论区直接指出。互动一下你手上的机器人是什么本体跑具身模型踩过最离谱的坑是什么评论区聊聊——留下本体型号 任务类型 手头显存我抽空回你一个微调方案。想看哪个模型的保姆级部署文比如 π0.5 的 openpi 实战也直接留言点单。