中国智能体登顶全球OSWorld榜单!90.2%成功率刷新世界纪录!
2026年7月27日OSWorld榜首易主归中国团队。中国芯智能体“实在Agent”以90.2%的成功率登顶。历史最高分首个突破90%大关的智能体。实在Agent同时拿下总榜第一与Agentic Framework分榜第一实现双冠。刷新了海外巨头Meta、Anthropic、OpenAI等保持的公开最高纪录。标题01 OSWorldAI的“计算机驾驶执照考试”OSWorld是目前全球公认的“Computer-Use Agent”权威基准由香港大学、卡内基梅隆大学、滑铁卢大学等机构于2024年发表于人工智能顶级会议NeurIPS。核心定位是让AI智能体在真实的操作系统中像人类一样通过鼠标、键盘、屏幕截图等接口完成跨应用的复杂任务。与仅限网页或API调用的传统基准如WebArena、MiniWoB等不同OSWorld提供的是完整的真实桌面沙盒环境。OSWorld基准测试包含361个由专家精心设计的实战任务涵盖办公、编程、UI设计及系统管理等高频场景。智能体是否完成任务均由机器判定没有任何人工评价的主观偏差这也是OSWorld成为权威评测基准的主要原因之一。各大厂在发布旗舰模型时几乎都会引用OSWorld成绩。例如OpenAI发布GPT-5.4时强调“首次超越人类”Google发布Gemini 3.6 Flash时强调“83%全场最高分”Anthropic发布Claude Sonnet 5时强调“81.2%”。回顾OSWorld过往最好成绩这条曲线见证了整个行业的发展● 2024年OSWorld刚发布GPT-4o、Claude-3.5-Sonnet等当时最强智能体的成功率仅12.2%● 2025年5月UI-Evol增强智能体达到22.0%● 2025年12月Simular Agent S2达到72.6%首次超过72.36%的人类基线● 2026年5月Pointer达到83.6%再创新高● 2026年7月实在Agent达到90.2%登顶OSWorld双榜。两年时间从12%到83%这条曲线已经非常陡峭。而实在Agent的90.2%——在顶端再跃一步标志着Computer-Use Agent正式迈入“超高可靠性”的新阶段。标题02 三个数字看懂实在Agent的统治力在OSWorld全部361个硬核实战课题中实在Agent最终拿下了325.59分总成功率 90.2%。拆解细分领域得分实在Agent呈现出一种“多点领先、核心场景大幅领先”的格局常用办公与编程场景● 表格与文档Calc/WriterLibreOffice Calc拿下46.0/47Writer拿下22.0/23● 编程与多媒体VS Code/VLCVS Code拿下22.0/23VLC播放器拿下16.89/17● 演示与邮件Impress/ThunderbirdImpress演示文稿拿下42.96/47Thunderbird邮件处理拿下13.0/15。在这些日常高频场景中实在Agent保持着高完成度与稳定领先奠定了扎实的技术基本盘。核心难点场景在这之外真正让我们在榜单上拉开差距的是OSWorld中公认最难、最考验智能体硬实力的三个“地狱级”场景● 跨应用协同multi_apps78.81/93这是任务量最大、最易出错的场景93个任务。实在Agent获得78.81分领先第二名近10个百分点。它模拟的是真实办公中最繁琐的跨系统流程Chrome下载文件 → LibreOffice编辑数据 → 截图存档 → Thunderbird发送邮件。这种需要连续穿梭四五个软件的长链路任务展现了实在Agent卓越的长链路规划能力。● 图像处理gimp24.0/26GIMP界面充满了浮动面板、非标准工具栏和像素级微操堪称视觉AI的噩梦。在26个任务中实在Agent拿下24个成功率92.3%证明了我们在非标准界面视觉理解上的深厚积累。● 系统底层操作os24.0/24 100%满分在文件权限修改、进程管理、命令行操作等“错一步即全盘皆输”的任务中我们实现了零失误反映了底层执行闭环极高的稳定性。跨应用领先长链路规划力。GIMP领先非标准界面理解力。系统满分执行闭环可靠性。三项能力叠加构成了实在Agent在OSWorld上的整体优势。标题03 登顶的背后是“八年磨一剑”智能体领域有一个行业共识Agent Model Harness。模型Model是发动机提供通用智力和原始动力Harness工程套件/整车架构则是方向盘、变速箱、刹车与安全系统是把智力转化为“可靠行驶”的完整工程体系。为什么Harness如此关键在Stanford、清华等机构的论文中有一个研究证明在同一个底层模型的前提下仅改进Harness工程设计在OSWorld等基准上的性能差距可达6-10个百分点而在某些复杂任务上将原生代码Harness优化为自然语言与范式结合的Harness同一模型的得分甚至能从30.4%跃升至47.2%差距接近17个百分点这说明当模型能力逐渐同质化Harness工程化才是决定智能体“能不能真干活”的核心变量。但Harness的可靠性从来不是某一次技术突破的偶然而是长期的企业场景沉淀、操作数据积累和工程化迭代的必然。实在智能做智能体有一个“第一性原理”——你不能干的我能不能干谁的能力边界更广谁的成本更低、效率更高面对真实的操作环境API能跑通就跑APIAPI跑不通就用GUI——像人一样看屏幕、点鼠标把数据拿回来把事办成。这套“多模态”的Harness能力是实在智能从2018年成立第一天起就在打磨的基本功。此外作为自动化领域的行业领头羊实在智能已服务了超6000家企业客户90%为世界500强、央国企、上市企业和地方龙头。这意味着实在智能已在客户侧积累了海量真实桌面环境的操作数据、异常处理机制和行业流程模板。这些场景和数据正是Harness工程迭代最宝贵的原材料。因此实在Agent能拿下90.2%不是单一模型参数的胜利而是八年深耕自动化领域的行业Know-how、海量真实业务数据以及Harness工程体系三者叠加的必然结果。标题04 从基准高分走向生产力真正落地OSWorld榜单的登顶是技术演进的重要里程碑但它绝不是终点。如果说OSWorld是智能体考取“计算机驾照”的考场那么真正的考验在于能否驶入复杂、多变的企业真实生产环境。从“榜单高分”到“产业落地”实在Agent的突破正指向智能体演进的下半场从90.2%到工业级99.99%的可靠性跨越在真实企业的财务、HR或供应链场景中哪怕9.8%的失败率也可能引发重大业务风险如发错邮件、错填付款金额。实在Agent在自主执行的基础上构建人机协同与安全断路器机制——在涉及高风险、敏感数据的操作时自动提权确认提供“操作撤销与回滚”能力不断将工业级可靠性推向99.99%。跨操作系统与复杂动态环境的抗干扰能力OSWorld建立了优秀的Ubuntu虚拟机基准而工业界真实的办公环境充满了软件版本更新、随机广告弹窗、系统通知抖动、网络延迟卡顿等非标准干扰因素。智能体的落地价值在于即使界面样式微调、弹窗突然打断也能像人类员工一样灵活应对、自主纠错。可算账的商业ROI与全链路安全合规通过端侧轻量模型与云端VLM的混合调度实在Agent在降低Token推理成本与响应延迟上持续优化让智能体的运行成本远低于人力成本。同时打造符合企业级安全标准的沙盒隔离环境与全链路可审计日志确保智能体每一次点击、输入都可追溯、可归因、可合规。OSWorld的90.2%不仅代表着中国团队在智能体工程赛道上的断层领先更宣告了AI正在摆脱“只会聊天”的对话框形态真正接管屏幕成为能够驱动复杂软件系统、创造实际经济价值的数字劳动力。让AI真正“会干活”从基准高分走向生产力落地——这是登顶OSWorld的核心也是实在智能八年未变坚守的底座。高原之上再建高峰。