
文章目录前言1 先把三个分数掰扯清楚1.1 13.3%和38.3%是同一张卷子的两种答法1.2 7.78%是另一个赛道的成绩2 ARC这题为啥这么吃“记性”2.1 这不是选择题是闯关探案2.2 状态断了等于从头再来3 官方测试框架的“两层失忆”3.1 第一层干完就忘“为什么干”3.2 第二层历史太长直接删前面4 两个“开关”到底解决了啥问题4.1 retained reasoning把思路续上4.2 compaction把历史打包压缩5 Token少六倍为啥分数还能涨5.1 评分公式里根本没Token这一项5.2 真正的逻辑是少做无用功6 别忙着给两个功能分功劳6.1 现在只有两头的数据6.2 俩功能本身也不是完全独立的7 怎么测才算真的靠谱7.1 至少得做四组实验7.2 所有变量都得锁死8 评测得分得两条腿走路8.1 官方榜要的是公平8.2 生产场景要的是上限9 Agent评测得签“运行合同”9.1 模型名只是其中一项9.2 最终比的是系统前沿P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看传送门https://blog.csdn.net/qq_34419312前言最近AI圈又出了个能上热搜的料。同一个GPT-5.6 Sol跑同一个ARC-AGI-3公开测试集分数直接从13.3%冲到38.3%翻了快三倍。不少人截图转发OpenAI又偷偷憋大招了模型能力三倍跃升想多了。模型本身半毛钱没改变的是跑模型的“姿势”。说白了就是以前的测试框架一直在给模型喂健忘药现在把药停了模型终于能正常干活了。1 先把三个分数掰扯清楚1.1 13.3%和38.3%是同一张卷子的两种答法这俩数都是在Public公开数据集上跑的。一个用ARC官方的测试框架一个用OpenAI自己基于Responses API写的框架。相当于同一张卷子一个要求写完一页就把草稿纸扔了一个允许保留草稿接着写。最终差出来的25个百分点是框架的差距不是模型本身的飞跃。1.2 7.78%是另一个赛道的成绩还有个7.78%的数很多人会拿来凑增长曲线。别凑。这是ARC官方半私密验证集的成绩跟公开集根本不是一套题。就好比你平时模考60分正式高考50分你不能说你从模考60分涨到了在家刷题90分三者根本不是一个口径。公开集和半私密集难度、判分逻辑都有区别硬拉一条增长线纯纯是耍流氓。2 ARC这题为啥这么吃“记性”2.1 这不是选择题是闯关探案ARC-AGI-3不是那种看完题直接选答案的考试。它是给你一个没说明书的二维小游戏你得一步步试摸规则找规律然后通关。就像玩密室逃脱得挨个道具试记下来哪个有用哪个没用最后拼出解法。这里面最值钱的不是你点了哪一下是你为啥点这一下、验证了啥、排除了啥。2.2 状态断了等于从头再来要是每走一步就把你刚才的思路全清空。下一步你就得对着历史记录重新想我刚才为啥走这步我要验证啥来着走一步忘一步那效率能高就怪了。官方有个对比很直观同样花了差不多的Token官方框架还在第一关晃悠优化后的框架已经闯到第五关了。差距不是最后一秒拉开的是每一步都在越拉越大。3 官方测试框架的“两层失忆”3.1 第一层干完就忘“为什么干”官方框架每执行一步环境操作就把模型的内部推理过程全扔了。模型下一轮只看得见“我刚才点了坐标(46,4)”但忘了“我点这是为了测蓝色区域是不是传送门”。相当于你上班做项目每次开完会都把会议记录和思路草稿全删了。下次开会先花半小时复盘我上次干到哪了我为啥要这么干一天下来光复盘了正经活没干多少。3.2 第二层历史太长直接删前面不光丢推理历史记录长了也删。字符数超过17.5万最前面的消息直接滚动删掉。到这一步就更狠了连“我早期做过什么实验”都忘了。两层失忆叠在一起模型就会反复踩同一个坑重复验证已经被否定的假设纯纯做无用功。4 两个“开关”到底解决了啥问题4.1 retained reasoning把思路续上第一个东西叫retained reasoning保留推理状态。很多人一听“保留推理”以为能偷看模型的内心OS。想多了。原始思维链是加密的开发者拿不到明文。就像你去存包给你个取件码你能拿码取东西但你看不见柜子里别人放了啥。它本质就是系统内部帮你存档下一轮接着上一段思路继续往下走。4.2 compaction把历史打包压缩光续思路还不够历史一直涨上下文总有装不下的一天。第二个东西compaction就是干这个的快到上下文上限的时候把之前的状态和推理压缩成更短的内容。相当于你把几十页的会议记录整理成一页核心要点信息还在占的地方小多了。当然这不是无损压缩官方也没说能百分百还原所有细节核心状态能保住就够了。5 Token少六倍为啥分数还能涨5.1 评分公式里根本没Token这一项很多人会觉得Token少了省下来的空间用来思考所以分高了。没这么直接。ARC用的RHAE评分只看你闯到第几关、用了多少步有效操作。你内部推理写再多字只要没改变游戏状态都不算数。Token多少跟分数没有直接的因果关系。5.2 真正的逻辑是少做无用功那为啥Token少了分还涨了因为状态连续了不用反复重新定向、重复踩坑了。无效的思考少了无效的操作也少了省下来的预算就能用来闯更多关。而且这个评分是平方计算的你操作数比人类多一倍得分就只剩四分之一效率影响被放得很大。但具体这25个百分点里有多少是这个原因贡献的现在还说不准。6 别忙着给两个功能分功劳6.1 现在只有两头的数据现在公开的结果就两个端点全关13.3%全开38.3%。中间只开一个的效果怎么样没人知道。既没有只开retained reasoning的数据也没有只开compaction的数据。就像你感冒了既吃了药又喝了热水病好了你能说清是药管用还是热水管用吗6.2 俩功能本身也不是完全独立的更麻烦的是这俩功能还不是完全正交的。compaction压缩的内容里本身就可能带着之前的推理状态。你以为你关了推理保留只要压缩功能还在说不定状态就偷偷跟着过去了。所以现在网上很多人给俩功能算贡献比例基本都是瞎猜当八卦听就行。7 怎么测才算真的靠谱7.1 至少得做四组实验真想把这事掰扯明白至少得设四个实验组。第一组纯基线就用官方框架啥都不开当参照物。第二组只保留推理不压缩看看在上下文装得下的范围内光续思路能涨多少分。第三组不用原生压缩自己做结构化的状态记录看看显式存关键信息比直接删强多少。第四组两个全开就是现在的最优结果。这样测出来谁贡献多少才说得清。7.2 所有变量都得锁死做实验最忌讳变量不统一。模型版本、推理强度、提示词、游戏版本、评分规则、动作预算、Token上限但凡有一个没固定结果就没法比。很多人测出来的“提升”扒开一看要么提示词改了要么预算放宽了纯纯作弊。测Agent不比测选择题变量多了去了漏一个结论就站不住脚。8 评测得分得两条腿走路8.1 官方榜要的是公平ARC官方其实说得很明白官方排行榜不用专门优化的测试框架。为啥因为官方榜要比的是模型本身的通用能力大家用统一的接口、统一的规则才好比。要是允许各家自己写框架、加状态、做优化那就变成比谁的工程能力强、谁的API私货多了。那就失去模型对比的意义了。8.2 生产场景要的是上限但反过来做产品的人肯定关心最优表现。我用你们家推荐的API、最佳实践到底能做到多好这就是生产对齐的评测测的是落地的上限。两种评测回答的根本不是一个问题没必要非得分个高低。以后看评测先搞清楚它是测公平性的还是测上限的再看分数才有意义。9 Agent评测得签“运行合同”9.1 模型名只是其中一项以前大家报成绩就说“某某模型在某某基准上得了多少分”。放到Agent时代这远远不够。模型、API、提示词、状态策略、上下文处理、环境版本、预算、运行证据八类信息一个都不能少。就像你说你跑马拉松破三得说清在哪跑的、什么天气、用的什么鞋、有没有人带跑不然成绩不算数。9.2 最终比的是系统前沿以后Agent评测比的就不是一个孤立的分数了。是一整条前沿线质量怎么样、花多少Token、延迟多高、成本多少、能不能复现、能不能审计。不同的运行合同对应不同的结果。只甩一个分数出来不说清楚怎么跑的要么是不懂行要么是故意耍流氓。说白了这次三倍分数的事给整个行业提了个醒。Agent时代模型能力只是下限运行系统才决定上限。以后再看到某某模型跑分暴涨的新闻先别急着喊“又进化了”。先问问你这是怎么跑的P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看传送门https://blog.csdn.net/qq_34419312