OrcaPlayground 四足机器人 RL 训练实战:从踩坑到闭环完整指南
OrcaPlayground 四足机器人 RL 训练实战:从踩坑到闭环完整指南摘要:本文记录了在 Windows 11 环境下,基于 OrcaPlayground 框架,使用 Stable-Baselines3 (SB3) PPO 算法训练 Lite3 四足机器人行走的全过程。重点解决了 PyTorch GPU 版本安装、复杂的依赖版本冲突(Dependency Hell)以及 Windows 批处理脚本的兼容性问题,最终实现从仿真到训练的完整闭环。1. 背景与目标OrcaPlayground 是一个基于 MuJoCo 物理引擎的机器人强化学习训练框架,配合 OrcaLab 实现仿真渲染与 RL 训练的分离。本次目标:跑通 SB3 PPO 算法,让 Lite3 四足机器人在仿真环境中学会行走。硬件环境:Windows 11 / NVIDIA RTX 显卡 / Miniconda2. 第一关:驱动与 CUDA 的兼容性在执行nvidia-smi后,显示驱动版本为580.92,对应 CUDA13.0。关键认知:NVIDIA 驱动是向下兼容的。虽然驱动支持 CUDA 13.0,但这并不意味着必须安装 CUDA 13 的 PyTorch。实际上,PyTorch 官网最新的cu128(CUDA 12.8)完全可以在该驱动上运行。3. 第二关:PyTorch 的“假”安装(CPU vs GPU)很多初学者(包括我)在这里踩了坑:执行pip install torch后,虽然显示安装成功,但torch.cuda.is_available()始终返回False。原因:pip默认源(包括清华源等国内镜像)经常推送+cpu版本,看起来装好了,实际上没有 CUDA 后端。解决方案:必须强制指定官方 CUDA 索引。# ❌ 错误做法(默认拉取 CPU 版)pipinstalltorch# ✅ 正确做法(指定 CUDA 12.8 索引)pipinstalltorch --index-url https://download.pytorch.org/whl/cu128验证成功标志:importtorchprint(f"ver={torch.__version__}, cuda=