尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness

贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness 在很多人的印象里AOE Tech Labs 是一家以产品创新见长的公司。2026 年 1 月Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境开创了 Agent 桌面工作台这一形态4 月FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络任务可以跨人、跨 Agent 交接而上下文不断5 月FloatSchedule 让 Agent 不必等人下指令按日程自己开工。三次发布三个此前市面上没有的东西全部围绕真实办公场景。但这三件事没有一件是界面创新。外界看到的是产品形态每一次底下动的都是 Harness。8 月 7 日他们把这层底座直接摆上了榜单 ——Floatboat Harness 在五项第三方基准上的完整评测数据。底座用的是市面上可能最便宜的模型 DeepSeek V4 Flash成绩超过了一众海外顶尖模型。前面三次这层技术是以产品形态交付的这一次它自己上场接受计量。这件事之所以值得单独看是因为它填的是行业里一块公认重要、却长期没人报数的空白。大家早就承认那个等式Model Harness Agent。加号左半边被反复计量每次模型发布都附一张榜单。加号右半边 —— 模型之外的那半个系统包括模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里 —— 从来没有一把尺子。这份数据要回答的就是右半边到底值多少分。而它给出的答案可以用四个字概括多快好省。一、先看「好」$0.175 打 $10五项全部超越Floatboat 这次的测试底座是 DeepSeek-V4-Flash官方 API 谁都能调输入 $0.14 / 百万 token、输出 $0.28。按 Agent 场景典型的 3:1 输入输出比折算混合价 $0.175/M。对面是 Claude Opus 4.8$5 / $25混合价 $10/M—— 贵 57.1 倍。图 1$0.175 的底座五项全部超过 $10 的旗舰 左混合单价对比DeepSeek-V4-Flash $0.175/M 对 Claude Opus 4.8 $10/M贵 57.1 倍线性轴不作对数压缩。右零线即 Opus 4.8 的位置五项全部落在其右侧条长为相对领先幅度小字为两套系统原始得分Floatboat : Opus 4.8。这些领先幅度要和左图一起读 —— 又好又便宜成本只有对手的 1/57。五项全部超越。「好」在 Agent 这件事上是硬门槛 —— 一个工作台如果交付不了真实任务再便宜也不会有人每天打开它。而过去这道门槛只能用钱换能干活的太贵敢放开用的干不动活。这份数据要说的是这个交换可以被取消。而取消它的不是模型。二、这不是一次「便宜模型真香」这种价格反差的第一反应通常是低价模型追上旗舰的老故事。但这次的数据自己把这个读法否掉了。同一个 DeepSeek-V4-Flash跑在 DeepSeek 官方自己的 Harness 上DeepSWE 只有 54.4低于 Opus 4.8 的 58.0。放到 Floatboat 上它跑到了 67.25。更完整的一组对照更能说明问题在 Terminal Bench 2.1 上DeepSeek 官方 Harness 与 Opus 4.8 打成平手82.7 : 82.7其余四项全部落后。也就是说同一个模型在模型厂自己的系统里对 Opus 4.8 一项没赢接入 Floatboat 之后五项全胜。模型权重没变单位成本没变。变量只有一个。三、一次刻意用最便宜模型做的单变量实验值得先把方法学摆完整因为整个结论的合法性都压在「单一变量」这四个字上。Floatboat 公布的对照配置是双方统一使用 DeepSeek-V4-Flash 0731 模型底座DeepSeek 官方公开基准中的 Code Agent 任务使用 DeepSeek Harness即将发布的极简模式配置为 max 档位、top_p0.95、temperature1.0Floatboat 侧统一在 Floatboat Evaluation Harness 下执行大部分基准的模型推理由 DeepSeek 官方 API 提供所有任务在完全隔离、开箱即用的物理沙盒环境中独立运行输入参数完全一致。这里有一个容易被读漏的细节对照组不是「裸模型 API」而是模型厂自己的 Harness。54.4、73.2、82.7、25.1、70.7 这五个数字是 DeepSeek 官方系统的成绩模型厂的工程能力也在场。这让对照比「产品对裸 API」严格得多也让差值更难被解释成「对手没认真配」。还有一个刻意保守的选择对照取 0731 正式版而不是更早的 Preview checkpoint。如果用 PreviewDeepSWE 一项就是 7.3 → 67.25涨幅 821%—— 一个漂亮得多的数字。但那里面混进了模型自身后训练的迭代不能归给 Harness。这一行数据在官方总表里也在Floatboat 没有拿它做宣传口径。至于为什么选最便宜的模型理由是反过来的用顶级模型跑榜会得到「高分 归因不清」没人能判断分数来自模型还是 Harness。锁死同一个最便宜的底座一边接官方 Harness一边接 Floatboat Harness差值就只能落在 Harness 上。这是更严苛的证明条件不是更容易的那个。产品本身模型中立支持接入各家主流模型本次单一底座只是评测方法论的要求。四、真正的信息在排列顺序里如果只看「五项都赢了」这还只是一次跑分。有信息量的是增益的分布。把同底座的 Harness 增量单独拉出来图 2模型不变只换 Harness任务越长程Harness 增益越大 左同一个 DeepSeek-V4-Flash 0731 底座两端分别为模型厂官方 Harness 与 Floatboat Harness。右按程长从短到长排列1.9%短→ 9.6%中→ 12.6%中长→ 19.9%中长→ 23.6%长五项全部具备官方 Harness 对照程长分档非递减、增益单调递增无例外项。Toolathlon 与 BrowseComp 同属中长程档同档内按增益排序。1.9% → 9.6% → 12.6% → 19.9% → 23.6%。五项全部有官方 Harness 对照按任务程长从短到长排下来程长分档非递减、增益单调递增没有例外项。任务越长程Harness 的增益越大一路涨到 23.6%。五项里只有 BrowseComp 官方未披露平均步数它的「中长程」是依任务设计判断的结论 —— 多跳检索、搜索引擎首屏无法直接回答检索链长度事前不可知需跨源证据交叉验证单次任务的检索与核验轮次与 Toolathlon 同量级。它与 Toolathlon 同属中长程档同档内按增益排序两者先后不代表程长差异。任务链条越长、环节越多、越依赖跨步骤的状态维持与自我修正Harness 的增益越大任务越短、越单点、越接近一次性问答增益越小。而真实工作恰好是长程的那一类。用户日常要处理的不是一条命令是跨文件、跨应用、跨很多步、中途还要改主意的活儿。这条规律指向的正是 Harness 在真实工作里的作用域。五、五套题都不是自己出的上面所有数字的分量取决于题目是谁出的。图 3五项基准的出品方与关键设计 没有一项是自家出的题其中 BrowseComp 出自 OpenAI 官方在这张 OpenAI 自己出的榜上Floatboat 的 87.80 超过了 GPT-5.6 Terra87.5贵 25.7×、Claude Sonnet 584.7贵 22.9×、Opus 4.884.3贵 57.1×和 GPT-5.6 Luna83.3。「113 个完全未泄漏的代码库平均改 7 个文件、新增 668 行」「47 个 SaaS、近 500 个 API 端点还混着陈旧数据」—— 这类任务过不去提示词技巧那一关。它要求真实的文件存取、多步排错、跨应用状态维持以及在错了之后自己发现并纠正。这也解释了增益为什么集中在长程任务上短程任务考模型的单次输出质量长程任务考的是整个执行系统。六、HLR给 Harness 装一把尺子Floatboat 给 Harness 划的边界是这么一句「Floatboat 正在把前沿模型能力转化为领先的 Agent 产品。这其中除模型本身以外的所有工作都属于 Harness 的范畴。」配套提出的指标叫 HLRHarness Leverage RatioHarness 杠杆率。它问的其实是一个很朴素的问题同一笔预算花在换模型上还是花在换执行系统上哪边更值价格只用来决定拿哪个模型当参照不进入公式本身 —— 分子分母都是同一项基准上的分数差。写成一个人人能看懂的分式HLR 换 Harness 的收益/换模型的收益分子是模型不动、只把 Harness 换掉成绩涨了多少分母是 Harness 不动、把模型升级到一个更强的参照系统公开成绩涨了多少。所以 HLR 1 的含义很直接只换 Harness 拿到的增量已经超过升级到那个参照模型所代表的整段公开性能跨度。以 DeepSWE 代入DeepSeek 官方系统54.4Claude Opus 4.8 公布成绩58.0两个公开系统之间只差 3.6 分同一个 DeepSeek 模型放到 Floatboat 上67.25多拿 12.85 分不换模型、只换 Harness拿到了 3.6 倍于「升级到贵 57.1 倍的 Opus 4.8」所代表的公开性能跨度。给需要精确定义的读者完整形式为B 为同一项 BenchmarkSB (M,H) 为模型 M 与 Harness H 组合后的系统成绩M 是保持不变的底座模型H0、H1 分别为基线 Harness 与待测 Harness(Mr,Hr) 是用来标定模型跃迁幅度的参照模型系统。要求所有成绩来自同一评价口径按 Benchmark 分别计算不跨基准求平均。参照系统的选法有一条先声明的规则这点决定了指标能不能被采信主参照统一用 Claude Opus 4.8如果它在某一项上不比基线系统更高那一项就没有发生模型跃迁改取该项最便宜的有效参照取最便宜的而不是分数最高的是因为分母要衡量的是一次真实的、代价最小的模型升级 —— 理性用户真会选的那条路。规则先定再取数。图 4HLR换 Harness 的收益 ÷ 换模型的收益 柱内为分子Harness 增量与分母基线到参照系统的公开差距。虚线为 HLR 1此线以上意味着只换 Harness 的增量已超过升级到参照模型所代表的整段公开性能跨度。Terminal Bench 一项的参照按规则兜底为 GPT-5.6 Luna该项全部候选参照的 HLR 区间为 0.26×~1.42×。0.78× → 1.14× → 1.32× → 1.62× → 3.57×。序列与程长规律一致按程长从短到长排列分档非递减、HLR 单调递增没有例外项越长程Harness 的杠杆越高。† 这一项换了参照系统而换参照的原因本身就是个结论Opus 4.8 在 Terminal Bench 上是 82.7与 DeepSeek 官方 Harness 一模一样。把模型换成贵 57.1 倍的旗舰这一项公开成绩一分没涨模型不变、只换 Harness涨了 1.56 分。既然没有发生模型跃迁它在这一项就不能当参照。按规则改取最便宜的有效参照 GPT-5.6 Luna84.7贵 2.6×得 1.56 / 2.00 0.78×。若改取 Claude Opus 583.8可以算出 1.42×Floatboat 没有采用 —— 规则事先就固定了唯一取值不允许在候选里择优。这一项全部有效参照的 HLR 区间是 0.26×~1.42×Sol 0.26× Terra 0.33× Qwen3.8-Max 0.40× Luna 0.78× Opus 5 1.42×Floatboat 把整个区间也一并公开了。HLR 是本次提出的新指标不是行业标准换参照系统数值会变。但它的分子分母全部是第三方基准的公开分数参照选择规则也公开任何人都可以自己重算也可以反过来用它核算 Floatboat。七、12.85 分从哪来长程任务到底是怎么失败的提示词工程、上下文压缩、工具重排这类手段的增益通常在 1–3 分量级。要解释一个量级更大的差值得先回答一个更基本的问题。Floatboat 的答案是长程任务的失败通常不是「某一步答错了」而是循环没有收敛 —— 它与真正的交付标准越走越远。走远有两个成因一个在人这一侧一个在模型这一侧。一是交付标准在任务开始时并没有被完整说出来。真实工作不是标准答案题人的意图往往随着中间产物逐渐清晰许多关键标准 —— 语气是否准确、方案能否落地、结构是否符合真实决策流程、结果是否足以直接交付 —— 在第一句话里根本不存在。二是模型自身的偏移在长程任务里会被逐轮放大。这是概率生成的固有属性每一轮的输出都带一点点偏差而下一轮又要把上一轮的产物当作前提。短程任务里这点偏差看不见二十步之后它会累积成方向性的错误 —— 上下文里最初那句要求被逐渐挤出、稀释、改写模型带着一个已经变形的目标继续往前跑而且跑得很自信。偏移不需要出错就能致命每一步看起来都合理合起来却不是要交付的那个东西。这两件事叠在一起就是长程任务的真实处境目标本身是模糊的、会变的而承接目标的模型又在持续漂移。没有一个系统层持续把它拽回来跑得越久离交付标准越远。这是他们对「Proactive」的定义所指向的地方。今天不少产品把定时唤醒、自动执行预设动作称为「Proactive Agent」。按 Floatboat 的说法那只是触发器的主动不是 Agent 的主动。真正的 Proactive Agent OS不在于系统能否在没人点按钮时开始工作而在于当用户只说出一个模糊目标、甚至自己也还不完全知道什么才算好时Agent 能否在长程任务中不断探索、执行、观察、修正与自我反思主动识别结果与目标之间的差距。用他们的原话主动性的高级形态不是替用户定时执行而是帮助用户发现自己真正要什么并把它做到。这条判断也解释了那组按程长排列的数字任务越长未被说明的标准越多被放大的模型偏移也越多「持续逼近」的价值就越大任务短到只有一次问答既没有可逼近的空间也没有足够的步数让偏移累积起来。23.6% 与 1.9% 的差距量的就是这件事。为什么这要求整个栈都在自己手里「持续逼近交付标准」听起来像设计理念落地却需要四层能力同时成立。在行业普遍基于 Claude Agent SDK 套壳做应用、几周就能出一个 demo 的时候AOE Tech Labs 选择自研 Runtime、Agent Loop、Tools、Infra以及 FloatSail (Evolution System)。这条路慢得多、重得多在当时看不到回报。而这四层各自决定了什么恰好对应长程任务的四种死法Runtime 决定 Agent 能碰到什么 —— 进程、文件系统、权限、沙盒边界。DeepSWE 要平均修改 7 个文件、新增 668 行代码AutomationBench 要在 47 个 SaaS、近 500 个 API 端点之间穿行这些任务的前提是真实的读写权和执行权不是把文本递进去再取出来。Agent Loop 决定长程任务能否收敛。它不是让模型机械地多跑几轮而是让每一轮探索都缩短当前结果与交付标准之间的距离从执行中获得新信息从观察中发现偏差从失败中修正路径从中间产物里反推用户没明说的要求该回退时回退该追问时追问。前面说的两种走远都要在这一层被按住。对模糊目标它负责把标准逐轮问出来、试出来对模型偏移它负责不让偏差过夜。这意味着每一轮的目标锚点要被重新对齐而不是任其在上下文里被稀释 —— 什么信息必须原样留在窗口里、什么可以压缩、什么该丢判断错了偏移就开始累积也意味着系统要能对自己的中间产物做校验在偏差还只是偏差的时候把它按回去而不是等它长成方向性错误。一个只会往前跑的循环跑得越久错得越远一个会回头核对的循环才可能在第 20 步还朝着最初那个目标。上面说的那种「主动」物理上就住在这一层。Tools 决定模型能否正确消费结果。工具的粒度、返回结构、错误语义 —— 一个把失败包装成空字符串的工具会让模型在第 15 步做出一个自信的错误决策。这类问题在单轮问答里看不见在 20 步任务里是致命的。Infra 决定失败能否被发现。状态持久化、并发、可观测性 —— 如果一次长程执行的中间状态无法回溯那连「哪一步坏了」都不知道优化就无从下手。四层里任意一层是别人的上限就是别人的上限。当 SDK 的 Agent Loop 在第 20 步丢了上下文套壳者能做的只有换个提示词绕一绕自研者可以直接改循环。这是「能不能修」的差别不是「修得好不好」的差别。FloatSail (Evolution System) 解决的是时间维度和个性化的问题模型多、更新快任务越来越复杂。它让 Runtime、Loop、Tools 与模型适配策略在真实任务反馈中持续演进并在新模型出现时延续已经形成的系统能力。「技术上只有自己完全可控的系统才能驾驭高度不可控的模型实现最大化模型的智能。」 —— AOE Tech Labs 团队回到开头那个判断 —— 为什么每一次产品形态创新底下动的都是 Harness这个技术判断与团队构成直接相关。创始人拥有 10 年 OS AI 创业经历与亿级用户产品经验两位技术合伙人中一位拥有模型训练经验另一位具备 OS 底层技术栈经验。模型训练、操作系统底层与亿级产品工程三类能力汇合团队自然会把 Agent 当成系统工程问题而不是提示词问题。产品见长和技术见长在这里不是两件事能把「用起来舒服」做到位的团队本来就得先把 Runtime 和 Loop 攥在自己手里。八、再看「多」榜单跑的是一个被削薄的环境这份成绩单还有一个反直觉的注脚它比用户真实拿到的环境弱。评测为了可复现而剔除变量产品为了能干活而叠加能力两者本来不是同一个东西。用户实际使用的 Floatboat 客户端把文件管理器、文件编辑器、浏览器原生集成进了产品本身并接入 3000 多个在线服务和各类多模态模型。市面上的 Agent 产品几乎千篇一律进去就是对话框选一个固定文件夹作项目入口AI 生成的文档要去别处打开编辑AI 要用浏览器还得装插件或征用你正在用的浏览器。Floatboat 的绝大部分工作在一个窗口里完成不需要打开文件选择器上传不需要决定下载到哪里拖拽即可。对 Agent 而言这些不是界面是可调用的工具面更多可用工具、更短的环境往返、更完整的执行闭环。AOE Tech Labs 确认完整客户端环境下运行同一批基准成绩高于本文公布的数字具体分数后续披露。「产品设计上只有让人用的舒服才能最大化人的潜力。」 —— AOE Tech Labs 团队顺着那条程长规律看这件事是自洽的工具面越宽人用得越舒服隐性知识越多长程任务的增益越大。而真实工作全是长程任务。所以榜单上的数字是保守下限。那个待披露的差值可能比榜单本身更有意思。如果 HLR 回答了「Harness 值多少分」这个差值将回答下一个问题优秀的人机交互设计值多少分。九、「快」和「省」便宜到不需要掂量Agent 才会被真的用起来最后回到成本这一侧它的意义不只是省钱。这五项基准全部是任务完成质量材料中没有延迟或耗时数据因此这里不对推理速度作任何数据声称。「省」是明账。混合价 $0.175/M 对 $10/M五项全胜的对手贵 57.1 倍。往上看整张价目表更贵却分数更低的参评系统在 AutomationBench 上是 9/9、Toolathlon 4/4、BrowseComp 6/8、DeepSWE 5/8、Terminal Bench 5/9。而「快」指的是这个价格带来的使用方式改变。一个长程任务的成本可以忽略跑歪了重跑一次代价同样可以忽略。Opus 4.8 贵 57.1 倍很多团队用它时要先掂量这一趟值不值。当成本低到不需要掂量Agent 才会被真的用起来而不是被珍惜着用。「快」的另一半在人这一侧客户端省掉的那些找文件、上传、下载、切应用的往返。所谓总周转时间从来不只是首 token 延迟 —— 找到文件要多久Agent 能不能直接读写保存浏览器和在线服务是否在同一个执行环境里中途失败能不能回退而不是从头再来用户改了要求能不能沿用已有上下文继续。这几件事合起来才是「快」在这份材料里的确切含义。多、快、好、省四件事在这份数据里第一次同时落地提升任务种类更多环境往返更快五项基准更好成本还便宜 57.1 倍。又快又好AI Agent 工作台才能真正进入日常工作。能干活的太贵、敢放开用的干不动活 ——Agent 长期卡在演示阶段卡的就是这里。这份数据要说明的是这个交换可以被取消而取消它的不是模型是 Harness。十、现在就能自己跑一遍上面所有数字都可以复算。入口是 floatboat.ai点击阅读原文可以访问。AOE Tech Labs 同步推出了基于 DeepSeek 的专版首月注册 5 元 / 1 美金对应的正是这份榜单的测试底座 DeepSeek V4 Flash—— 你拿到的是同一个模型。验证路径很短用同一个模型对比它在别处和在 Floatboat 里的表现差距。同模型、不同 Harness差值就是答案。建议直接拿长程任务试因为那是杠杆最大的一段也是日常真正在干的活让它改一个跑得起来的仓库、把一份真实资料做成可交付的报告或者把一个模糊的想法交给它看它能不能帮你把标准先想清楚。
返回列表