OpenForge RL:适配任意环境的智能体运行时原生训练框架
OpenForge RL适配任意环境的智能体运行时原生训练框架论文原链接https://arxiv.org/html/2607.21557v1摘要现代大模型智能体普遍依赖复杂运行时(\mathcal{H})arness如Claude Code、Codex、OpenClaw完成多轮推理、工具调用与外部系统交互。但现有开源SFT/强化学习RL训练框架无法原生支持带多进程、状态维护的运行时推理只能简化重写运行逻辑造成「训练-部署不一致」鸿沟。本文提出OpenForge RL开源框架核心由轻量代理与K8s任务编排器两大组件构成代理拦截并记录运行时所有模型调用标准化输出可接入veRL等主流RL框架的训练轨迹编排器在云容器中独立调度每条交互样本实现任意运行时、任意环境的规模化端到端训练。我们在两类复杂智能体场景完成全量验证命令行工具智能体Claw-Agent基于30B MoE基座训练仅用数百至数千条任务在ClawEval、QwenClawBench、MCPAtlas基准分别取得31.7(pass³)、55.9(pass3)、33.7(pass1)、28.1(pass1)显著超越同规模开源基线多模态GUI智能体GUI-Agent电脑/浏览器操作8B多模态模型在OSWorld-Verified、Online-Mind2Web、WebVoyager分别达到37.7、63.0、72.3持平甚至数倍优于更大规模同类开源模型。除性能评测外依托原生运行时训练能力本文首次定量分析「运行时选型」与「RL训练」对智能体行为的塑造作用轻量化对齐运行时更容易学习单运行时训练具备跨运行时泛化能力RL主要提升智能体可靠性工具覆盖、自校验、多步骤规划完成度但错误修复能力仍存在短板。本文将完整开源代码、数据集、训练脚本降低各类运行时智能体的强化学习研究门槛。图1论文整体示意图。左OpenForge RL整体架构打通任意运行时、环境与标准RL训练库消除训练部署差异右Claw与GUI两类智能体在6套主流评测基准的对比柱状图。目录引言相关工作2.1 智能体推理运行时2.2 基于运行时的智能体训练方法3.1 符号定义3.2 OpenForge RL核心架构3.2.1 交互样本编排3.2.2 异步样本执行与超时机制3.2.3 异常容错处理3.3 任务数据自动生成流水线实验4.1 命令行Claw智能体4.1.1 监督微调(SFT)与RL数据集4.1.2 完整训练超参与流程4.1.3 评测基准与协议4.1.4 实验结果对比4.2 GUI多模态智能电脑/浏览器4.1 SFT与RL数据构建4.2 训练配置4.3 评测标准4.4 结果分析讨论5.1 不同运行时下模型表现差异5.2 未见过的新运行时泛化能力5.3 RL训练习得的核心智能能力结论致谢参考文献附录A 完整训练细节A.1 Claw智能体训练完整参数A.2 GUI智能体训练电脑/浏览器分模块附录B 数据集完整说明B.1 数据生成流水线完整流程B.2 Claw任务数据明细B.3 GUI电脑/浏览器任务数据细分附录C 全部评测基准执行细节C.1 ClawEval、QwenClawBench评测流程C.2 MCP-Atlas评测配置C.3 OSWorld电脑操作评测C.4 Mind2Web/WebVoyager浏览器评测附录D 行为定量分析完整实验D.1 工具调用分布分析ZeroClawD.2 Codex运行时下智能体行为雷达指标1 引言当前大模型智能体广泛落地软件工程、命令行工具、桌面GUI、网页浏览器等开放场景但主流智能体均封装一套推理运行时(\mathcal{H})arness如Claude Code、OpenClaw、Codex负责多轮上下文管理、子智能体调度、工具调用封装、外部服务通信。运行时直接决定智能上限但现有开源训练框架存在两大核心痛点训练与部署割裂veRL、OpenRL(\mathcal{H})F等标准RL库仅支持单轮、轻量工具交互无法原生兼容多进程、带内部状态的商用运行时研究者只能简化复刻运行逻辑训练环境与真实部署环境不一致模型上线性能大幅衰减。规模化资源冲突GUI、命令行环境均需独立容器隔离资源传统RL框架将样本进程与训练GPU绑定无法弹性调度海量并行交互容器训练成本极高。本文核心贡献提出OpenForge RL通用训练架构由拦截代理K8s云编排器构成实现「任意运行时 × 任意环境」接入标准RLGRPO等无需修改训练内核所有运行时交互轨迹自动标准化兼容veRL等主流开源训练栈。跨领域大规模实证覆盖文本命令行工具、多模态桌面/浏览器两类完全不同的智能体场景仅少量自动生成任务即超越同规模基线GUI场景匹敌数倍参数量模型提供完整可复现实验。运行时行为定量研究首次在真实部署运行时完成训练后拆解运行时复杂度、RL优化对智能体行为的影响揭示泛化规律与当前能力短板。图2OpenForge RL完整数据流架构。左侧为标准RL训练模块veRL推理/训练器中间代理与编排核心拦截所有模型调用、重构交互轨迹右侧云容器沙箱隔离各类运行时与环境新增运行/环境仅需修改容器镜像无需改动训练代码。2 相关工作2.1 智能体推理运行时SWE-Agent等早期工作证明专用人机交互层可大幅提升代码任务效果后续Claude Code、OpenClaw、Codex等成熟运行时集成子智能体、长上下文规划、批量工具调用GUI领域Kimi-Agent、Molmo-Web封装截图视觉交互、键鼠动作。现有研究聚焦运行时设计本文反向研究如何在成品运行时内部完成端到端RL训练消除训练部署鸿沟。2.2 基于运行时的智能体训练veRL、Slime等开源RL框架支持PPO/GRPO但仅适配简单单轮工具交互复杂多进程运行时训练需重度定制训练循环扩展性极差。同期Polar框架仅覆盖软件工程场景本文覆盖文本多模态双大类、6套评测同时完成运行时行为机理分析。3 方法3.1 符号定义将环境交互建模为马尔可夫决策过程M⟨S,A,T,R,γ⟩\mathcal{M}\langle\mathcal{S},\mathcal{A},\mathcal{T},\mathcal{R},\gamma\rangleM⟨S,A,T,R,γ⟩。标准ReACT框架下每一步观测sts_tst→ 策略πθ\pi_\thetaπθ输出动作ata_tat→ 状态转移st1s_{t1}st1仅保留原始交互序列。而带运行时KaTeX parse error: Cant use function \( in math mode at position 10: \mathcal{\̲(̲\mathcal{H}\)}(…的智能体输入输出被运行时封装原始交互被隐藏本文定义完整轨迹KaTeX parse error: Cant use function \( in math mode at position 28: …angle(\mathcal{\̲(̲\mathcal{H}\)}(…KaTeX parse error: Cant use function \( in math mode at position 10: \mathcal{\̲(̲\mathcal{H}\)}(…为运行时处理后的输入上下文代理拦截全部KaTeX parse error: Cant use function \( in math mode at position 10: \mathcal{\̲(̲\mathcal{H}\)}与模型的请求提取标准化训练样本供GRPO等分组强化学习使用。3.2 OpenForge RL核心架构两大核心模块代理服务器、K8s交互编排器整体流程见上图2。3.2.1 交互样本编排基于Orchard云容器调度系统实现资源弹性分配每条交互样本独立创建K8s Pod容器隔离环境资源桌面GUI、命令行沙箱、浏览器支持Azure/AWS等公有云可动态扩缩并行样本数量不会阻塞GPU训练任务。3.2.2 异步样本与超时机制样本进程完全独立于训练节点单条卡死不会阻塞全局训练批次。为每条容器任务设置全局墙钟超时阈值超时直接终止容器向代理返回错误标记训练流程继续采集其他正常样本解决长任务卡死问题。3.2.3 异常容错处理网络故障、运行时崩溃、环境报错的不完整轨迹直接丢弃避免错误奖励信号污染梯度未来可针对部分完成轨迹设计信用分配方案。轨迹重构公式代理拦截所有运行时-LLM交互任务结束后重构带折扣回报样本KaTeX parse error: Cant use function \( in math mode at position 20: …\{(s^\mathcal{\̲(̲\mathcal{H}\)}_…本文γ1\gamma1γ1仅使用任务最终成功/失败终端奖励GRPO分组对比计算优势函数。3.3 任务数据自动生成流水线面向数据稀缺的GUI、命令行智能体场景设计全自动任务生成流水线批量产出SFT监督轨迹与RL交互任务。图3数据集自动化构建5阶段完整流程任务生成→过滤清洗→环境构建→自动化测试→迭代修复最终产出带可复现容器、校验脚本的标准任务。流水线5阶段生成候选任务基于网页、开源任务库、API知识库生成真实场景指令筛选去重剔除重复、不可行、逻辑残缺任务构建运行环境生成Docker镜像、校验脚本适配Claw/桌面Xvfb虚拟屏/远程浏览器自动化测试调用强模型执行验证任务可完整跑通迭代修复测试失败则自动修改环境、指令循环至校验通过。产出任务附带完整Dockerfile、校验脚本同时支持SFT蒸馏强模型轨迹与RL在线交互训练。图4三类训练任务领域分布饼图Claw命令行、电脑GUI、网页浏览器任务细分占比。表1 Claw/GUI训练数据集总量| 数据集指标 | Claw命令行 | 电脑GUI | 浏览器GUI ||—|—|—|| SFT轨迹数量 | 892 | 795 | 1496 || RL训练任务数 | 343 | 252 | 900 || 适配运行时 | ReACT/ZeroClaw/OpenClaw/Codex | Kimi-Agent修改版 | MolmoWeb修改版 |4 实验4.1 命令行Claw智能体文本工具调用4.1.1 SFT与RL数据基于Claw(\mathcal{H})ub、ZClawBench素材生成流水线任务每条任务绑定4类主流运行时ReACT基准、ZeroClaw、OpenClaw、Codex。SFT采用MiniMax-M2.5强模型轨迹蒸馏RL使用流水线生成343条全新交互任务。4.1.2 训练完整配置基座Qwen3-30B-A3B MoE激活参数量约3B训练后端veRL优化器GRPO硬件8×B200 GPUAzure云容器执行样本超参批次8分组大小8完整超参见附录A.14.1.3 评测基准ClawEval报告pass³、pass3基准原生ReACT运行时QwenClawBenchpass1基于OpenClawMCPAtlas89个无第三方凭证标准任务覆盖率≥0.75记成功。表2 Claw智能体全部基准性能对比| 模型 | ClawEval pass³ | ClawEval pass3 | QwenClawBench pass1 | MCPAtlas pass1 ||—|—|—|—|| 头部闭源大模型Claude Opus4.6 | 70.8 | 80.8 | 59.5 |76.4 || 同规模基线Qwen3-30B原生 | 14.3 | 39.8 | 21.8 | 12.4 || OpenForge-Claw(SFT) | 21.7 | 52.1 | 32.1 | 23.6 || OpenForge-Claw(SFTRL) |31.7|55.9|33.7|28.1|4.1.4 结果分析仅数千条自动生成任务SFTRL相比原生基座在全部基准大幅提升强化学习在线交互显著提升多工具规划、任务完成稳定性。4.2 多模态GUI智能体电脑浏览器4.2.1 数据构建电脑端AgentNet、合成桌面素材生成252条RL任务浏览器端WebGym过滤真实网站任务900条RL样本SFT全部使用Kimi-K2.5轨迹蒸馏。4.2.2 训练配置基座Qwen3-VL-8B多模态模型输入仅截图训练框架veRLGRPO云端容器运行Xvfb虚拟桌面/远程Chromium。完整超参见附录A.2。4.2.3 评测基准OSWorld-Verified桌面操作、Online-Mind2Web、WebVoyager网页交互全部报告pass1。表3 GUI多模态模型性能| 模型 | OSWorld-Verified | Online-Mind2Web | WebVoyager ||—|—|—|| 头部闭源GPT5.4 |75.0 |92.8 | - || 8B基线Qwen3-VL原生 |29.4 |38.7 |49.2 || OpenForge-GUI(SFT) |34.4 |57.4 |61.5 || OpenForge-GUI(SFTRL) |37.7|63.0|72.3|4.2.4 结果8B规模模型在WebVoyager超越MolmoWeb(8B)基线Online-Mind2Web提升24.3个百分点证明OpenForge可适配视觉、键鼠交互的复杂GUI运行时。5 讨论5.1 不同运行时学习难度差异评测OpenForge-Claw在四类运行时表现ReACT、ZeroClaw性能远高于OpenClaw、Codex。原因轻量运行时工具注册简单、上下文冗余更少模型更容易对齐复杂商用运行时长提示、嵌套子智能增加学习难度。表4 多运行时ClawEval表现| 模型 | ReACT pass1 | ZeroClaw pass1 | OpenClaw pass1 | Codex pass1 ||—|—|—|—|| 原生基座 | 26.1 |32.5 |11.4 |12.2 || SFTRL训练模型 |45.1 |48.5 |20.9 |32.5 |5.2 跨运行时泛化能力仅在ZeroClaw训练的模型在未见过OpenClaw/Codex上仍有显著提升同时在多运行时混合训练后全部运行时性能进一步上涨说明多样工具调用模式带来通用智能能力。表5 单/多运行时训练泛化效果| 训练运行时 | ZeroClaw | OpenClaw | Codex ||—|—|—|| 仅ZeroClaw训练 | 13.5 | 3.3 | 4.6 || 三类混合训练 | 16.0 | 9.5 | 20.3 |5.3 RL习得的核心智能能力图5左ZeroClaw下工具调用占比RL大幅减少通用shell调用转向专用业务工具右Codex运行时五大行为指标雷达图RL在格式鲁棒、工具覆盖、自校验、步骤效率全面提升仅错误修复提升有限。定量分析五大核心智能指标格式鲁棒性减少非法工具调用步骤效率缩短完成任务平均步数工具全覆盖完整调用任务所需全部工具自校验执行修改类工具后主动读取验证错误恢复工具报错后重试、调整方案。结论RL显著提升前四项但错误恢复能力提升幅度最小属于当前模型明显短板需要专门数据与优化目标。6 结论本文提出OpenForge RL开源训练框架解决现有RL库无法原生兼容各类智能体运行时的痛点通过拦截代理标准化运行时交互轨迹结合K8s弹性容器编排实现任意运行时、任意环境下大模型智能体端到端强化学习彻底消除训练-部署不一致。在文本命令行、多模态桌面/浏览器两大场景验证框架有效性同等参数量下性能全面超越开源基线依托原生运行时训练定量揭示运行时复杂度、RL优化对智能体行为的塑造规律。全部代码、数据集、完整训练评测脚本开源为运行时智能体的强化学习研究提供通用基础设施。未来工作将优化部分轨迹信用分配、专门增强错误修复类智能能力。