尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Qwen AgentWorld:1000万轨迹训练的语言世界模型,让AI智能体“预演”7大环境

Qwen AgentWorld:1000万轨迹训练的语言世界模型,让AI智能体“预演”7大环境 Qwen-AgentWorld: Language World Models for General Agents作者Yuxin Zuo, Zikai Xiao, Li Sheng, Fei Huang, Jianhong Tu, Yuxuan Liu, Tianyi Tang, Xiaomeng Hu, Yang Su, Qingfeng Lan, Yantao Liu, Qin Zhu, Yinger Zhang, Bowen Yu, Haiquan Zhao, Haiyang Xu, Jianxin Yang, Jiayang Cheng, Junyang Wang, Lianghao Deng, Mingfeng Xue, Tianyi Bai, Yang Fan, Yubo Ma, Yucheng Li, Zeyu Cui, Zhihai Wang, Zhihui Xie, Zhuorui Ye, An Yang, Dayiheng Liu, Jingren Zhou, Ning Ding核心发表机构论文源码未明确标注或暂未可靠识别论文链接arXiv:2606.24597v1发布于arXiv 预印本cs.CL|—|—|—|| MCP | JSON 工具调用 | 工具响应文件内容、数据库等 | 事实世界知识 || Search | Web 搜索 / Web 提取器 | 对话历史查询 结果 | 事实世界知识 || SWE | Read / Edit / Bash / … | 工具输出文件内容 diffs | 代码执行推理 || Terminal | Bash 命令 / 键击 | 终端输出stdout shell 提示符 | 长上下文因果推理 || Android | Touch / Swipe / Type / … | UI 视图层级 应用状态 | 视觉状态推理 || Web | Click / Type / Navigate / … | 可访问性树 浏览器状态 | 视觉状态推理 || OS | Mouse / Keyboard | 可访问性树 窗口/应用状态 | 视觉状态推理 |其中 GUI 领域Android、Web、OS的环境观察统一以无障碍树accessibility trees与 UI 视图层级UI view hierarchies表示而非像素帧这使得所有领域都可以在一个文本生成模型内统一处理。下图展示了部分领域的典型交互GUI 域中智能体通过点击、键入改变界面状态文本域中智能体通过命令、工具调用获得结构化输出。训练流水线遵循“CPT injects, SFT activates, RL sharpens”的核心原则。Stage 1 CPT 通过非思维轨迹注入环境世界知识与专业领域语料Stage 2 SFT 将下一状态预测激活为显式思维模式Stage 3 RL 通过混合 rubric-and-rule 奖励锐化输出质量。三个阶段的训练数据池严格不相交且所有数据统一遵循上述轨迹模式。3.2 关键模块 / Key Modules3.2.1 数据收集与统一处理由于不存在覆盖如此广领域、规模足够大的公开数据集论文从三个互补来源收集环境轨迹。第一专用代理基础设施部署容器化执行沙箱、MCP 服务器、带完整 shell 状态跟踪的持久终端会话以及持久 Android、浏览器、桌面 OS 环境通过自动合成任务查询并让智能体系统端到端执行持续产出可扩展、受控、可复现的交互数据。第二开放环境交互轨迹从终端会话记录、开源智能体工具调用日志等公开来源收集真实交互这些轨迹噪声大、结构异质需要通过多代理清洗流水线完成获取、去噪、分段、语义对齐与质量评分。第三内部智能体轨迹来自内部基础模型在常规模型开发中积累的覆盖全部 7 个领域的智能体轨迹统一转换为环境轨迹格式。所有轨迹经过统一的“轨迹到轮次展开”trajectory-to-turn expansion处理任意轮次t tt都可以作为预测目标输入为前t − 1 t-1t−1轮交互与第t tt轮动作目标为第t tt轮观察训练时对每条轨迹随机采样一个 turn。数据过滤方面轨迹级丢弃少于 2 轮的序列、清理 MCP/SWE 中调用未声明工具的轨迹、排除受环境故障影响的 GUI 轨迹turn 级则设计了两个关键机制重试循环跳过跳过“垃圾输出→错误→重试”循环中的违规对同时保留当前状态以保证状态链完整与无变化轮过滤GUI 域中删除动作前后状态无有效变化的轮次避免教模型“无论什么动作都复制前一状态”。系统提示模板的构建采用 AutoResearch 自动优化将提示优化形式化为最大化保留轨迹上预测准确率的研究问题通过“优化器代理提出候选提示 → 世界模型推理 → judge 打分 → 优化器根据失败模式修订”的 10 轮迭代并行 12 个运行生成 12 个模板变体 v0–v11RL 使用 v0CPT 使用 v1SFT 每样本从 v2–v11 随机采样以最大化提示格式多样性。SFT 与 RL 训练数据规模如下平均 tokens 19,443平均 turns 13.4领域SFTRL Train平均 tokens平均 turnsMCP1794,15662,70228.9Search1,04220,00418,8736.2Terminal1,58034,1255,80512.0SWE2498,18136,73424.7Android1,33711,49830,06419.3Web1,6058,71619,41710.2OS1,1025,62825,43912.4总计7,09492,30819,44313.43.2.2 Stage 1 CPT信息论损失掩码CPT 阶段使用标准 next-token prediction 目标训练将环境轨迹建模为世界建模任务system prompt 定义模拟上下文user turns 承载动作assistant turns 承载环境响应。除环境轨迹外CPT 还加入专业领域世界知识语料覆盖工业控制与制造、网络安全、法律与法规、医学与医疗、金融、时事与百科知识等使模型能够泛化到训练域之外的专业环境。CPT 的关键创新是信息论损失掩码Information-Theoretic Loss Masking。工具使用轨迹中许多轮是样板化的如工具回声输入、API 镜像请求参数这些轮产生的梯度质量低但不能删除因为后续轮依赖它们作为上下文。因此论文对每个 (action, observation) 对计算四个统计量OL ∣ W act ∩ W obs ∣ ∣ W act ∣ Nov ∣ W obs ∖ W act ∣ ∣ W obs ∣ Jac ∣ W act ∩ W obs ∣ ∣ W act ∪ W obs ∣ R ∣ obs ∣ ∣ act ∣ ( 字符级长度比 ) \begin{aligned} \text{OL} \frac{|W_{\text{act}} \cap W_{\text{obs}}|}{|W_{\text{act}}|} \\ \text{Nov} \frac{|W_{\text{obs}} \setminus W_{\text{act}}|}{|W_{\text{obs}}|} \\ \text{Jac} \frac{|W_{\text{act}} \cap W_{\text{obs}}|}{|W_{\text{act}} \cup W_{\text{obs}}|} \\ R \frac{|\text{obs}|}{|\text{act}|} \quad (\text{字符级长度比}) \end{aligned}OLNovJacR​∣Wact​∣∣Wact​∩Wobs​∣​∣Wobs​∣∣Wobs​∖Wact​∣​∣Wact​∪Wobs​∣∣Wact​∩Wobs​∣​∣act∣∣obs∣​(字符级长度比)​根据这些统计量每一轮被归入 7 个语义类别之一并赋予不同的保留比例keep ratio类别统计特征直觉KeepretrievalNov ≥ 60%, R 1read_file→ 内容100%expansionOL ≥ 50%, Nov ≥ 50%, R 1.5fetch→ 页面 元数据100%actionNov ≥ 50%, R ≤ 1 或短send_email→ “sent”100%transformNov 50%, R 1长输入 → 状态词50%boilerplateOL ≥ 50%, Nov 50%API 回声10%echoOL ≥ 70%, Nov 30%think(x)→{thought:x}5%other未分类—100%被掩码轮次的 token 仍然保留为后续轮次的上下文但不计算损失。这解耦了“学习下一状态”与“学习下一 token”模型只在携带真实环境信息的轮次上获得监督。由于分类完全基于词重叠统计而非工具名该机制具有工具无关的通用性。3.2.3 Stage 2 SFT激活思维模式与拒绝采样CPT 之后模型虽已学会工具返回格式与状态演化知识但对下一状态的知识只是隐式掌握。SFT 的目标是将 next-state prediction 显式激活为推理模式识别动作请求、回忆先前状态、预期响应格式从而减少幻觉、提高长轨迹上的状态一致性。SFT 仍使用标准 next-token prediction上下文窗口为 256k tokens。SFT 数据构造包含两道关键工序。第一是Prompt 模板多样化每个样本的默认 system prompt 替换为从 10 个模板变体中均匀采样的一个轨迹动态内容保留并重新注入使同一轨迹接触多样化提示格式提升跨 system prompt 的泛化性。第二是拒绝采样每个查询由通用推理模型生成 3 个 rollout独立 judge 两两比较选出最高质量轨迹若最高分低于阈值则丢弃该查询。最终从 10,250 条候选轨迹中保留 7,094 条保留率 69.2%。领域Candidate 查询数保留率Final SFT 数平均 turnsMCP26168.6%17924.3Search1,46671.1%1,0423.3Terminal1,82686.5%1,5805.9SWE40261.9%24926.9Android1,97567.7%1,33715.9Web2,69759.5%1,6053.0OS1,62367.9%1,1025.4总计10,25069.2%7,0948.53.2.4 Stage 3 RL混合奖励与训练稳定性RL 阶段使用 GSPO 算法。世界模型 RL 面临两个突出挑战。第一环境反馈预测是开放式的难以用单一指标衡量。第二存在极强的 prompt–output 不对称prompt 为到预测轮为止的完整轨迹历史常达数万 token而输出是单个预测观察通常只有几百到几千 token。因此计算成本由 prompt 处理主导而非生成。RL 池的 prompt 上限设为 128k tokens。奖励设计结合两个互补信号。五维 rubricLLM judge从 Format、Factuality、Consistency、Realism、Quality 五个维度对预测观察打分每维 1–5 分总奖励 平均分 × 5取值范围 [5, 25]每个领域使用定制 judge prompt并包含内容类型分类以减少不可复现细节带来的假阴性。规则验证器rule-based verifier对携带可执行 ground-truth 的数据产生二值 0/1 信号缩放到 [0, 25] 作为客观锚点。两者按9:1rubric:rule组合既保留多维度的语义反馈又用严格二值信号缓解奖励黑客。在此设计下模型被迫学习“模拟环境本身”而非“让 judge 满意”因为预测中插入自我赞美或回显 judge 关键词会被内容分类器归入确定性区域并获得零分。论文还系统对比了三种开放式奖励设计。Reference-Reward让 judge 进行配对 A/B 测试判断预测观测与基线输出哪个更接近 ground-truth问题在于二元奖励稀疏、且当两个输出都合理时 judge 偏好不稳定。Turing-Test Reward让 judge 判断观测是否来自真实环境假阴性率太高几乎不收敛。最终采用五维 rubric 规则验证器即使观测空间多模态也能提供稳定且有信息量的梯度。训练稳定性方面论文识别出两个关键失败模式并给出解决方案。其一是多轮展开导致的奖励坍缩当训练轨迹按轨迹到轮次展开为多个共享长公共前缀的样本时训练会因奖励方差坍塌而快速崩溃解决方案是限制 RL 池中每条轨迹恰好采样一个 turn使每个样本有唯一预测目标。其二是奖励塑形奖励公式的选择对收敛有强烈影响但第三个失败模式及其解决方案在提供的资料中未给出细节。另外附录报告显示RL 训练中五个 rubric 维度的改善速率明显不同Factuality 相对提升最大11.3%但始终是得分最低的维度说明事实世界知识是环境模拟中最难的部分。四、实验 / Experiments4.1 数据集与评估指标 / Datasets MetricsAgentWorldBench 是本文提出的专门用于评估 LWM 的基准其构建遵循四个原则。广泛使用的查询所有任务查询来自既有高质量智能体基准如 Tool Decathlon、Terminal-Bench 1.0 2.0、OSWorld-Verified 等而非自建任务前沿智能体轨迹所有轨迹由前沿模型智能体生成其长思维链、工具调用组合与错误恢复序列具有足够复杂度真实观测每条轨迹附带真实环境执行的 ground-truth 观测作为评估参考分布外训练数据与基准查询在数据源层面隔离评估的是泛化能力而非记忆能力。数据收集方面论文将 5 个前沿智能体部署在 9 个既有基准查询集上对真实环境执行以产生智能体轨迹。文本领域早期子集Terminal-Bench 1.0 和内部 SWE 基准用 Claude Sonnet 4.5 收集其余文本域轨迹仅用 Claude Opus 4.6 收集GUI 领域额外加入 3 个 Qwen 家族模型覆盖扩展到 5 个前沿模型。Turn 级采样策略方面文本领域采用非对称采样每条轨迹保留第一轮测试无交互历史的初始模拟且错误会通过状态链递归传播与最后一轮上下文最长对累积状态依赖最强再加三个均匀采样的中间轮共 5 个评估轮。GUI 领域则选择性地采样更有挑战性的轮次。轨迹转轮次扩展后保留均匀的 50% 随机样本最终形成2,170 个评估样本文本域占 72.4%SWE 21.8%、Search 21.1%、Terminal 16.3%、MCP 13.2%三个 GUI 域各占 9.2%。平均上下文长度方面MCP 最长59,300 tokens因系统提示中嵌入完整工具 schemaTerminal 最短12,900 tokens。评估协议的核心是五维 rubric。LLM judge 在五个维度上对预测观测分别打分主分数为五个维度的均值并缩放至 [0, 100]维度评估内容Format输出是否符合领域结构约定MCP 的 JSON 合规性、Terminal 的 shell 提示模式Factuality所述事实文件内容、搜索结果、工具返回值是否正确Consistency输出是否内部连贯且与前几轮连贯Realism模拟是否与真实环境的行为特征匹配Quality相对 ground-truth 的完整性和简洁性参考锚定判断是最重要的设计judge 同时接收 ground-truth 环境观测与模型预测观测通过两者比较打分将开放端质量判断转化为事实比较大幅缩小 judge 幻觉空间这是跨 judge 一致性配对 Spearmanρ 0.92 \rho 0.92ρ0.92–0.99 0.990.99的主要原因。针对环境观测中不同内容的可预测性差异论文定义了差异化匹配标准确定性内容回显输出、文件读取、计算结果必须精确匹配既有环境内容预装软件版本、非轨迹创建的文件只需格式与合理性验证运行时元数据时间戳、PID、内存地址只需格式与范围验证。Judge 的筛选通过双盲图灵测试校准实现给定交互历史与当前动作judge 在随机顺序的真实观测与世界模型输出中识别真伪高图灵测试准确率的 judge 被选为最终评测者。在候选 judgeGemini 3 Flash、Claude Sonnet 4.5、GPT-5.2中GPT-5.2 平均图灵测试准确率最高最终被采用。4.2 主实验结果 / Main Results实验共评估 14 个基线模型5 个前沿专有模型Claude Opus 4.8、Claude Opus 4.6、Claude Sonnet 4.6、GPT-5.4、Gemini 3.1 Pro、4 个开放权重模型DeepSeek-V4-Pro、Kimi K2.6、GLM-5.1、MiniMax-M2.7以及 5 个无 LWM 训练的 Qwen 系列 checkpoint用于隔离世界模型训练的增益。推理设置统一为 temperature 0.6 并启用 thinking mode。下表列出核心评估结果五维 rubric 均值0–100模型MCPSearchTerm.SWEAndroidWebOSAvg.Claude Opus 4.854.9335.1459.1864.1061.5054.6666.6256.59Claude Opus 4.669.9029.3057.5164.5561.7451.4270.2057.80Claude Sonnet 4.670.0028.7956.9864.5258.0350.7863.1756.04GPT-5.470.1037.2653.6966.2960.0051.8068.5858.25Gemini 3.1 Pro59.0730.2152.4759.0761.4052.8366.9254.57Qwen3.5-35B-A3B基座57.8725.9846.1347.5853.1847.1056.2747.73Qwen-AgentWorld-35B-A3B64.7936.6953.9665.6358.1749.5565.9256.39Qwen3.5-397B-A17B基座68.3130.8155.3064.4454.9048.5560.8554.74Qwen-AgentWorld-397B-A17B68.2437.8257.7368.4960.2050.9867.8958.71总体来看Qwen-AgentWorld-397B-A17B 以 58.71 的平均分超过所有前沿专有模型GPT-5.4 为 58.25。分域来看其优势集中在文本域文本域平均 58.07超过 GPT-5.456.841.23 分其中 Terminal57.73 vs 53.69与 SWE68.49 vs 66.29两类需要精确建模代码执行状态与工具 API 行为的领域优势最大。GUI 域方面Claude Opus 4.860.93与 Claude Opus 4.661.12领先Qwen-AgentWorld-397B-A17B 排名第五59.69差距被归因于多模态预训练的优势是纯文本世界建模尚未完全捕获的。两个值得注意的领域发现Search 是最难的领域所有模型最佳分数37.82约为 SWE 最佳分数的一半这是因为 Search 需要对持续变化的 Web 内容建模且跨长检索链保持事实一致性MCP 领域则由 Claude Opus 4.6 与 GPT-5.4 并列最高约 70体现其工具使用专长。世界模型训练的增益十分显著。在 397B 规模上平均分从基座的 54.74 提升至 58.713.97在 35B 规模上提升 8.66 分47.73 → 56.39。这些增益不能仅由基础模型通用能力解释无 LWM 训练的 Qwen3.6-Plus50.81与 Qwen3.6-Max-Preview52.42均明显低于同等家族的 Qwen-AgentWorld。论文进一步对 LWM 的推理模式进行了机制分析。基于精选演示轨迹中跨 4 个文本域的 129 条思考痕迹Terminal 32 轮、MCP 32 轮、Search 32 轮、SWE 33 轮发现模型在生成中大量使用深思熟虑的自我纠正以“Wait!”作为显式认知中断重新检查中间预测并在提交前修正。129 轮中共计 1,347 次中断平均每轮 10.4 次单轮 SWE 峰值 56 次其中 Terminal 与 MCP 频率最高每轮 16.9 与 12.7 次反映更深的跨轮状态跟踪需求。中断被分为事实性捕获错误 API 响应格式、认识论识别上下文计算的极限与视角采样建模评估者意图或代理知识状态三种功能子类型。Search 域中还观察到信息泄漏预防模式模型明确识别查询与参考答案的主题不匹配确保生成的片段不会意外揭示目标信息。4.3 消融实验 / Ablation Study跨域泛化。论文设计了一个数据域消融实验仅用 Terminal 数据训练 Stage 3 RL每 10 步评估全部 4 个文本域。结果显示Terminal 本身域内从 SFT 基线的 32.8 提升至 47.014.2三个未接受任何领域特定训练信号的留出域也同步提升——MCP5.0、SWE11.5、Search11.8。这说明 RL 阶段强化的是可泛化的世界知识环境如何响应动作、错误如何传播、状态转换如何跨轮组合而非领域特定的输出格式。奖励设计对比。三种奖励设计的对比已在 3.2.4 描述Reference-Reward 收敛慢且 judge 偏好不稳定Turing-Test Reward 假阴性率高、几乎不收敛五维 rubric 规则验证器是唯一稳定收敛的设计。这一消融表明将开放端模拟质量分解为正交维度并保留二元锚点是 LWM RL 可行性的关键。模拟器质量消融OpenClaw。论文从真实 Claw Agent 轨迹中提取种子场景合成 4,000 个模拟训练环境环境侧变化状态、任务侧改写意图与难度以 Qwen-AgentWorld-397B-A17B 为模拟器对 Qwen3.5-35B-A3B 进行最多 50 轮交互的 Sim RL并在完全分布外的 Claw-Eval 与 QwenClawBench 上评估模型Claw-EvalQwenClawBenchQwen3.5-35B-A3B基座65.447.9Sim RLQwen3.6-Plus 模拟器66.71.347.8−0.1Sim RLQwen-AgentWorld-397B-A17B 模拟器69.74.355.07.1用 Qwen3.6-Plus 作为模拟器几乎无增益而 Qwen-AgentWorld-397B-A17B 在两个基准上均带来显著增益这直接证明专门的三阶段 LWM 训练流水线对模拟器质量至关重要。受控 vs 非受控 Sim RLMCP。论文对 MCP 环境注入定向扰动如间歇性 API 错误、需要后续调用的分页响应、批量操作的部分失败对比标准 Sim RL 与受控 Sim RL模型Tool DecathlonMCPMark 平均基线无 Sim RL32.421.5Sim RLw/ Qwen-AgentWorld-397B-A17B31.524.6Sim RLw/ Qwen-AgentWorld-397B-A17B controlled36.133.8Δ3.712.3关键负结果在于无控制指令的标准 Sim RL 不提供有意义的增益Tool Decathlon 反而下降 0.9说明可控性不是增益幅度的影响因素而是 Sim RL 在此领域生效的前提——没有接地模拟指令时训练信号过于嘈杂。MCPMark 上的更大增益则说明可控模拟对需要大量工具调用、需仔细处理中间结果的任务尤其有效。虚构世界与 Real RL 对比Search。论文构建 1k 个自包含虚构环境由 300–500 行的大型关系数据库锚定通过文档接地、LLM 引导填充、SQL 提取 ground-truth、反向生成自然语言查询的流程构建训练搜索代理。在 WideSearch 上35B 模型 F1 by Item 从 34.02 提升至 50.3116.29F1 by Row 从 13.72 提升至 24.2110.49397B 模型 F1 by Item 从 70.11 提升至 73.983.87。训练环境与真实搜索引擎完全无关代理从不与真实环境交互但学到的查询重表述、多源交叉引用与迭代结果聚合技能直接迁移到了真实搜索任务。对比可控 Sim RL 与使用实时搜索引擎的 Real RL 训练前 60 步Sim RL 的 F1 by Item 达到 50.3%超过 Real RL 的 45.6%。更具信息量的是行为分歧——两种训练都将 web_search 调用从每轨迹约 5 次降至约 3.5 次但 web_extractor 调用出现显著分歧Sim RL 从 2.5 次增加到 4.0 次Real RL 从 2.5 次减少到 1.5 次。这是因为可控模拟刻意扣留搜索片段的完整答案迫使代理学习“提取完整页面是组装完整答案的必要条件”而 Real RL 发现真实搜索片段通常已足够学会了跳过提取。这证明了可控模拟能针对性地塑造代理行为。统一范式验证LWM RL 热身。在 Qwen3.5-35B-A3B-SFT 上运行单轮、非代理的 LWM RL只做下一状态预测无工具调用、无多轮交互然后直接在 7 个多轮工具调用基准上评估同一模型不做任何额外微调模型Terminal-Bench 2.0SWE-Bench VerifiedSWE-Bench ProWideSearch F1 ItemF1 RowClaw-EvalQwenClawBenchBFCL v4 平均Qwen3.5-35B-A3B-SFT33.2564.4742.1833.3813.2753.6039.7662.29 LWM RL39.5567.8647.4246.1720.1464.8849.4371.25Δ6.303.395.2412.796.8711.289.678.96其中 Claw-Eval、QwenClawBench 与 BFCL v4 是三个完全未出现在 LWM 训练中的分布外基准BFCL v4 各子集增益为 Web 15.50、Mem. 6.46、Multi-T. 13.13、No Live 2.39、Live 1.85、Hallu. 2.06。机制上论文通过“预测驱动动作精化”prediction-driven action refinement解释这一迁移RL 训练后的模型在多轮评估中系统性地在执行动作之前对环境回应进行心理模拟。行为统计显示RL 训练将思考痕迹中显式预测下一环境状态的回合的预测准确率从 69.9% 提升至 78.3%8.4%。一个典型案例来自 Terminal-Bench 2.0 的 mailman 任务基座模型在配置transport_maps后陷入反复振荡、从不修改local_recipient_maps世界模型训练后的模型则准确预测出“Postfix 在传输路由被咨询之前就会在验证阶段拒绝收件人”从而直接修正配置对象所有测试通过。五、相关工作 / Related Work本文所处的相关工作谱系包括三个方向。世界模型谱系。从 LeCun 的 world-model–actor 架构lecun2022path到以像素/物理世界为核心的世界模型研究Genie 3、WorldLabs Marble 等领域共识是“预测世界是行动的前提”。本文与这些工作的根本区别在于将世界建模落实在语言智能体环境层面——覆盖真实工具、终端、代码与 GUI 交互并通过文本生成统一建模而非预测像素帧或物理状态。LLM 智能体研究。当前 LLM 智能体研究几乎只优化“状态→动作”策略世界模型组件长期缺失。本文系统地补上( s , a ) → s ′ (s, a) \rightarrow s(s,a)→s′这一侧并研究了 LWM 训练的完整数据管线、奖励设计与训练稳定性。与真实环境训练的关系方面本文明确区分 Sim RL 与 Real RL并论证二者的互补性而非替代性真实环境不具备 LWM 的 turn 级可扩展性与精确可控性。可控环境与虚拟世界。同期工作xu2026controllable也提出通过可控工具使用环境增强代理鲁棒性共享“保持 oracle 一致性的增广能够提升鲁棒性”的动机LiteResearcherli2026literesearcher独立构建虚拟搜索世界用于代理 RL 并实现 sim-to-real 迁移。本文的不同在于强调虚构世界的结构性优势答案只存在于虚构设定中时代理无法通过参数记忆绕过搜索工具且不会把训练时的模拟事实误认为真实世界知识。shrivastava2026echo的同期工作则在代理 RL 期间对环境观察标记添加辅助交叉熵损失使 Terminal-Bench 2.0 性能大幅提升这从互补方向独立验证了世界建模能力对代理性能的迁移价值。此外RL 训练稳定性的关键设计也与多轮 agent RL 中的“Echo Trap”wang2025ragen共享前缀导致奖励方差坍塌相关。六、局限性与展望 / Limitations Future Work论文提供的资料明确呈现了若干局限。第一GUI 域仍是短板Qwen-AgentWorld-397B-A17B 在 GUI 域排名第五59.69落后于 Claude Opus 4.860.93与 Claude Opus 4.661.12纯文本世界建模尚未完全捕获多模态预训练的优势。未来可探索视觉-语言融合的 LWM直接将屏幕像素或截图作为观察模态。第二Search 域整体困难所有模型在 Search 上的最佳分数37.82约为 SWE 最佳分数的一半。对持续变化的 Web 内容建模、跨长检索链保持事实一致性仍是开放挑战Factuality 在 RL 训练中始终是得分最低的维度说明事实世界知识是环境模拟中最难的环节。将更可靠的实时事实检索机制或结构化知识库引入 LWM 是值得探索的方向。第三可控 Sim RL 的适用性存在边界。MCP 实验表明无控制指令的标准 Sim RL 几乎没有增益甚至有害Tool Decathlon 32.4 → 31.5其成功依赖接地模拟指令提供足够信息MCPMark 的 Playwright 子集无论是否受控均为 0.0GitHub 子集无增益17.4 保持不变这些负面结果未被攻破。此外有状态环境的 Sim RL 有效性瓶颈在于初始状态细节提供给世界模型的初始状态不够详细时模拟保真度下降、下游增益减少。第四数据与工程成本较高。开放轨迹需要复杂多代理清洗流水线虚构世界构建需要多代理合成框架、SQL 验证与双重质量控制AutoResearch 生成系统提示虽大幅减少人工设计负担仍需人工审查。SFT 与 RL 仅使用内部积累轨迹可能受内部模型分布影响RL 池的 128k prompt 上限也会过滤超长轨迹。最后在真实环境中的行为最优性方面Sim RL 学到的行为模式如增加 web_extractor 调用在真实环境中可能并非必要如何设计可控指令使模拟行为与真实最优策略对齐仍需进一步研究。七、总结 / ConclusionQwen-AgentWorld 通过三阶段训练流水线CPT 注入世界知识、SFT 激活下一状态预测推理、RL 锐化模拟保真度构建了首批统一覆盖 7 个领域的语言世界模型。AgentWorldBench 的实证结果表明Qwen-AgentWorld-397B-A17B 在整体平均分上超越所有前沿专有模型且 35B 模型也具备超越同规模基线的显著增益。更重要的是论文展示了世界模型增强通用智能体的两条路径作为解耦环境模拟器LWM 通过可控模拟与虚构世界训练带来超过真实环境训练的收益作为统一智能体基础模型单轮非代理的 LWM RL 热身即可跨任务与跨领域迁移到多轮工具调用基准。这些结果共同表明语言世界模型不是真实环境的替代品而是推动通用智能体前沿的互补轴——它为智能体提供了可扩展、可控的内部模拟能力也提供了一种新的“先预测、后行动”的元推理基础。原文摘要:A world model predicts environment dynamics based on current observations and actions, serving as a core cognitive mechanism for reasoning and planning. In this work, we investigate how world modeling based on language models can further push the boundaries of general agents. (i) We first focus on building foundation models for agentic environment simulation. We introduce Qwen-AgentWorld-35B-A3B and Qwen-AgentWorld-397B-A17B, the first language world models capable of simulating agentic environments covering 7 domains via long chain-of-thought reasoning. Leveraging more than 10M environment interaction trajectories of 7 domains in real-world environments, we develop Qwen-AgentWorld through a three-stage training pipeline: CPT injects general-purpose world modeling capabilities from the state transition dynamics and augmented professional corpora, SFT activates next-state-prediction reasoning, and RL sharpens simulation fidelity through a tailored framework with hybrid rubric-and-rule rewards. To evaluate language world models, we present AgentWorldBench, a comprehensive benchmark constructed from real-world interactions of 5 frontier models on 9 established benchmarks. Empirical results demonstrate that Qwen-AgentWorld significantly outperforms existing frontier models. (ii) Beyond foundation models, we further investigate two complementary paradigms through which world modeling enhances general agents. First, as a decoupled environment simulator, Qwen-AgentWorld supports scalable and controllable simulation of thousands of real-world environments for agentic RL, yielding gains that surpass real-environment training alone. Second, as a unified agent foundation model, world-model training acts as a highly effective warm-up that improves downstream performance across 7 agentic benchmarks. Code: https://github.com/QwenLM/Qwen-AgentWorldPDF链接:https://arxiv.org/pdf/2606.24597v1部分平台可能图片显示异常请以我的博客内容为准
返回列表