尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

深度 | 谁在给浏览器 Agent 把关:当“能力上限“不再是问题,“谁负责它的错误“成了新产业

深度 | 谁在给浏览器 Agent 把关:当“能力上限“不再是问题,“谁负责它的错误“成了新产业 # 谁在给浏览器 Agent 把关当能力上限不再是问题谁负责它的错误成了新产业一、执行摘要过去几期我把浏览器 Agent 连续拆过产品格局8-17、安全信任8-21、生产落地8-24、收银台战争8-25。前两期我都在回答「浏览器 Agent 能不能干、怎么干得更好」上一期则在回答「干成的这一笔钱怎么分」。这一期我想问的问题更靠近底下那层地基——当大家都在算法竞赛里把能力刷到近乎饱和浏览器 Agent 真正卡住的其实一直是「可靠性」而围绕这个赤字一整条「把关产业链」正在成型。两个事实叠在一起构成了这篇的起点。事实一能力在涨可靠没跟上而且这是被系统性证明的。从最早期的 OSWorld人类 72.36%最优 AI 12.24%到 2026 年的 OSWorld 2.0——最难的 108 个长时程流程、单个任务中位约 1.6 个人类工时Claude Opus 4.8 在 500 步预算下也只完成 20.6% [A]。更有意思的是普林斯顿 ICML 2026 的那篇《Towards a Science of AI Agent Reliability》用 12 个可靠性指标量过 15 个模型后核心结论是——近年的能力跃升在可靠性上只换来了「微小」的改善 [A]。能答得对不等于能稳定不出错。事实二既然可靠性跟不上整条产业链就把「把关」当成一门生意来做。Gartner 的经典预测被反复引用——到 2027 年底超过 40% 的智能体 AI 项目会因成本与业务价值不清而被取消 [B]。当「幻觉导致项目失败」从论文变成采购话术市场上就开始长出四类把关者测评标准、人机混合运营、认证与合规栈、责任与保险——它们不生产 Agent只决定哪些 Agent 能上线、出事后谁负责。我判断浏览器 Agent 的下半场主战场正从「谁的模型能力强」转移到「谁负责 Agent 的错误、谁有权给 Agent 放行」。能力是入场券可靠性与「责任可归属」才是订单的分水岭。一个值得注意的悖论是这一层把关产业的集体判断反而可能比单个模型的能力增长更早决定浏览器 Agent 能走多远。二、一道被反复刷新的裂缝能力在膨胀可靠在原地先把它量化。可靠性赤字不是比喻是一组能放进论文的数字。2.1 从人机鸿沟到模型内卷基准的十二年最早期的浏览器/计算机使用基准给出了那张经典的「人机鸿沟」OSWorld 上人类任务成功率 72.36%、最优模型只有 12.24%约六分之一WebArena 上人类 78.24%、最优 GPT-4 系智能体 14.41% [A]。这是 2024 年——那时的问题一目了然机器连人类零头都没到。两年过去事情变了。OSWorld 2.0 把任务从「单屏幕操作」拔高到「跨多小时的长时程工作流」人类中位数约 1.6 工时一个任务Claude Opus 4.8 在 500 步预算下也只完成 20.6% [A]。这条线说明的不是「模型变笨了」而是把任务拉长到真实工作粒度后错误开始指数累积——浏览器 Agent 是顺序操作一步错往往要回滚好几步这就是第一台「错误放大器」。上图从「人机鸿沟」到「长时程任务挫败」浏览器 Agent 的可靠性缺口始终存在只是 2026 年它把任务拉长到了真实工作粒度暴露了「顺序操作错误累积」这台错误放大器。2.2 能力与可靠性的脱钩普林斯顿的冷水最狠的一盆冷水是定量的。普林斯顿 Nabla 中心Rabanser、Kapoor、Narayanan在 ICML 2026 发表的那篇论文用了 12 个可靠性指标一致性、稳健性、可预测性、安全性量测 15 个模型结论斩钉截铁近年的能力跃升只在可靠性上换来「微小」改善 [A]。换句话说「变聪明」和「变可靠」是两条几乎独立的曲线——一个模型可以考出更高的 OSWorld 分数但不会因此更少在任务中途跑偏。这解释了很多生产侧的怪象为什么 demo 总能惊艳一上生产就打折。不是厂商撒谎是能力与可靠性本来就不绑在一起。三、基准的罗生门注水、饱和与谁信谁如果能力与可靠脱钩那基准分数还能信吗这是把关产业的第一块阵地——测评标准。而这半年的情况恰好在两个方向同时恶化。3.1 注水实锤搜索时污染与掉分悬崖Deep Research 智能体的那篇论文arXiv:2606.05241给出了「search-time contamination」的量化证据web 搜索型智能体在评测时会检索到基准的 ground-truth最多把 6 个公开基准的分数注水 4% [A]。它不是「厂商自报好看」那种软注水而是带三条严重等级元数据泄漏→问题上下文泄漏→答案直接泄漏的机制性污染。更扎心的是 OpenComputer 的「掉分悬崖」开源模型在 OSWorld-Verified 上分数很高一换到新的 33 个 App、1000 个任务的可验证世界分数就「骤降」[A]。这直接证明了一件事很多分数不是「能力」是「见过这道题」——benchmark 到真实世界的迁移本身就是一口裂缝。3.2 饱和与内卷一年从 45% 卷到 90%是模型还是榜单动了再看另一侧OSWorld-Verified 的「SOTA」在过去一年从约 45%2025 年 8 月的 OpenCUA-72B一路卷到 90%2026 年 8 月的 Ouroboros 号称 90.69%[B]。一年翻一倍除了真进步更像是榜单在互相挤兑、评测集在快速过拟合——我上期写「基准接近天花板」时说的是能力真正逼近了这期我要修正逼近天花板的可能不是能力而是这套评测的口径本身。上图基准注水有两条被证实的机制——搜索时污染与「换世界骤降」共同指向一个结论基准分数不等于生产可靠把关层必须建立独立、可迁移的评测口径。我判断当厂商自己报的分数越来越难互信谁能提供独立、可复现、能迁移到生产环境的评测就成了第一个真正的把关生意。这不是学术问题是采购入口。四、把关键落到采购一整个放行产业链正在成型可靠性缺口一旦被定价市场就会长出负责「替人把关」的中间层。这一层有四块拼图分别卡在 Agent 生命周期的不同节点。4.1 测评与按评测放行eval-as-CI第一块是把可靠性测试变成类似软件 CI 的门禁。当 OpenAI、Anthropic 纷纷把 browser use / computer use 工具集转正 GA、执行层被交给开发者自带Playwright、Selenium、CDP之后谁在一个 Agent 改动后还能保证它不回归谁就有了价值——于是 eval platform以 LangSmith、Braintrust 为代表的评测/追踪平台从「可选项」变成了「上生产前必须过的门」[D]。这套逻辑是软件工程里最古老的那套不回归才放行。我判断这一层会先于模型本身成为企业采购单里的固定科目。4.2 人机混合运营把人工确认做成岗位而不是兜底第二块更反直觉靠人盯 Agent 正在从「不得已的兜底」变成「正规的岗位」。行业术语从「end-of-loop」Agent 干完人再审滑动到「center-of-loop」人在关键节点决策本质是把人放进决策回路里当作固定节点而非应急开关 [D]。Zero-trust 环境下这几乎成为标配——上上期8-24我写过中国厂商靠「云机 人工接管」过合规现在看这根本不是中国特例而是全球生产性 Agent 的通用形态一个 Agent 在三家不同公司手里配的也可能是三份不同密度的人工看护。4.3 但项目失败率的口径在打架这里要诚实「Agent 项目失败率」的数字本身正在被各方各取所需。Gartner 那句「40% 项目 2027 年前取消」被 Forbes、VentureBeat 反复引用 [B]IDC 那边又说「88% 的 AI agent 试点规模化失败」[C]而 Metrigy 的调研却反驳「多数 AI pilot 会进入生产」[C]。三个数字互相矛盾说明根本还没有统一的口径——这也正是把关产业还没有成熟到能给出「行业公认可靠率」的原因。谁先建立起一个被各方认账的可靠率口径谁就掌握了下一波采购的话语权 [D]。上图浏览器 Agent 的「放行产业链」由评测门禁、人机混合、认证合规、责任保险四段拼成——每一段都在回答「谁负责它的错误」而最上层的失败率口径至今仍无统一数字。五、责任坐实从服务积分道歉到责任不可逃避把关产业链的最后一环也是争议最大的一环是责任与保险。这里 2026 年的现实是产品有了但赔付逻辑还很粗糙。5.1 Agent 保修名不副实记者扒过所谓「AI agent uptime warranty」的真相出问题往往不赔现金只赔「服务积分」而且免责条款一大堆 [C]。这跟云 RTO/SLA 一个套路——但 Agent 的「故障」比服务器宕机模糊得多服务器是二进制挂了/没挂Agent 是「做错了一件事」的灰度。从保险视角看Agent 的错误还不可精确定义风险所以保险公司还在门外观望只有精明的 SaaS 在门口卖「积分式道歉」。我判断这正是下一波保险创新的空白地——谁先定义出「Agent 的错误保险责任」谁就解锁一块巨大的保费池。5.2 责任归属正在变成硬墙责任不清的问题也在被监管和法律推着往前走。美国加州 AB 316「AI No Defense Act」禁止以「AI 自主导致」作为免赔辩护 [C]欧盟 AI Act 第 50 条要求 Agent 自证 AI 身份、对跌倒负起责任 [B]在中国KYAKnow Your Agent自律公约与广州互联网法院的「双重授权」裁定把「谁授权、谁负责」写进支付与操作链路 [C]。三条线在同一个地方汇合「Agent 干的」不再是免责声明而是一个必须有人认领的责任主体。浏览器 Agent 越是靠近真实交易这块墙就越高、越硬。我判断浏览器 Agent 的商业化天花板最终不是被模型能力封死的而是被「错误了谁负责」封死的。谁先把责任坐实到可投保、可定价谁就先解锁生产侧的大订单——而这一层恰恰是最难被能力竞赛抹平的优势。六、三个判断把关生意如何重塑浏览器 Agent判断一可靠性与责任归属将成为比「基准分数」更值钱的差异化资产。当各家模型在 OSWorld-Verified 上卷到 90%分数已经无法区分企业采购决策真正拉开差距的是「你的 Agent 上了生产出错率多低、出错了谁负责」[D]。能力竞赛进入边际递减把关能力进入正回报——这是我这一期最重要的判断。判断二把关产业链会先于更强的模型出现赢家。评测门禁、人机混合运营、责任保险这三块的共同点是它们卡的是标准与信任不是算力——先发布的一方容易形成事实标准如上上期说的执行层被 browser-use 商品化同样逻辑[D]。谁先让「通过它的评测 可靠」成为采购口头禅谁就握住定价权。判断三我原以为到今修正浏览器 Agent 的规模化拐点不在更强的模型在更硬的责任基础设施。我原以为瓶颈是能力或成本——上上期写「怎么把 5% 推到 80%」时我还在技术路径里打转。现在我把砝码移到另一边真正卡住横向规模化的是责任与可靠的可证明性。换句话说信任的规模经济比能力的规模经济更接近这次的转折点 [D]。这是我对浏览器 Agent 叙事的一次明确再校准。七、投资与研究展望值得看多独立评测/可追溯平台eval-as-CI 与追踪厂商人机混合运营与人工看护服务商把 center-of-loop 做成标准化岗位Agent 责任与保险的产品化空白谁定义 Agent 可投保风险谁吃保费池把「责任可归属」写进合规栈的厂商EU AI Act / 中国 KYA 的合规工具链。值得警惕基准注水与评测口径混乱——「以基准论英雄」的叙事含金量在下降却仍被融资话术高频使用失败率数字被各方各取所需采购决策若无独立评测易踩空Agent 的错误责任若长期无法定价会反向压制浏览器 Agent 在金融、医疗等高责任行业的上线速度。关键监测指标下期起是否出现被多方认账的「可靠率」统一口径——把关产业成熟的先行信号。哪家评估/追踪平台先成为浏览器 Agent 上生产的事实门禁。Agent 责任保险是否出现首家真正承保错误风险的保险公司而非积分式道歉。EU AI Act 第 50 条与 KYA 的执行节奏如何把谁负责写进采购条款。校准验证能力竞赛是否如当前样张进入边际递减、把关能力是否开始直接定价。证据等级[A] 官方/一手 [B] 2可靠来源 [C] 单一来源 [D] 个人判断AI 辅助深度研究人工视角解读。每日更新。参考来源arXiv:2404.07972 — OSWorld: Benchmarking Multimodal Agents (2024)arXiv:2307.13854 — WebArena: A Realistic Web Environment (2023)arXiv:2606.29537 — OSWorld 2.0: Long-horizon workflows (2026)arXiv:2602.16666 — Towards a Science of AI Agent Reliability, Princeton ICML 2026arXiv:2606.05241 — Search-Time Contamination in Deep Research Agents (2026)arXiv:2605.19769 — OpenComputer: Verifiable Software Worlds for Computer-Use Agents (2026)arXiv:2608.08311 — Ouroboros: 90.69% OSWorld-Verified (2026-08)Channel NewsAsia — Gartner40% agentic AI 项目 2027 年前取消 (2025)Forbes — Why 40% of Agentic AI Projects May Be Canceled By 2027 (2026-07-07)IDC via MSN — 88% of AI agent proofs fail at scale (2026-07)Startup Fortune — Your AI Agent Uptime Warranty Probably Won’t Pay Out (2026-08)The Financial Brand — When AI Agents Make Incorrect Purchases, Who’s Responsible? (2026-05)VentureBeat — Enterprises winning with AI agents are limiting how much agents can do alone (2026-08)智谱 AutoGLM 官方文档 — AutoGLM-PhoneADB 控制设备火山引擎官方 — 豆包大模型与智能体平台、方舟 SOC 审计报告
返回列表