尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

AI助手真的会“越用越懂你“吗?一份专门用来戳穿这件事的成绩单

AI助手真的会“越用越懂你“吗?一份专门用来戳穿这件事的成绩单 你有没有过这种经历跟一个新来的客服机器人反复解释同一个问题第二天再问它又把你当陌生人。现在的AI个人助理号称能记住你的偏好、学会你的工作流程、越用越顺手。但这句话有多少是真的有多少只是产品文案里的漂亮话普林斯顿大学的一组研究者决定较真一下。他们做了一件听起来简单、做起来极其麻烦的事给AI助理们出了一套连续的、跨会话的考题专门检验它们是不是真的从过去的交互里学到了东西还是只是看起来学到了。这就是 **PAST-Bench****PAST-Bench**一个专门用来检验AI个人助理能否通过保留经验实现自我提升的评测基准全称对应论文标题中的Recursive Self-Improvement递归自我提升研究方向。这份研究最后逼出了一个新的助理框架叫 Hermes我们下面慢慢聊。一个容易被忽略的大问题AI记住了不等于用上了先说清楚这篇论文想解决的核心矛盾。现在市面上的个人AI助理比如 Hermes、OpenClaw 这类系统都会在后台维护一套持久化的记忆机制用户的偏好记录、常用的操作流程文件、历史会话索引。理论上这些东西攒得越多助理应该越懂你。但这里有个致命的模糊地带如果你发现助理今天表现比昨天好这个变好到底是因为它真的学会了你之前教它的东西还是因为今天这个模型本身就比较聪明、任务本身比较简单、或者纯粹是随机波动**没有对照实验你永远说不清这笔账**这就好比你吃了一种保健品一个月后感觉精神好了但你没有设立不吃药的对照组没法确定这是保健品的功劳还是因为这个月你恰好睡眠更好、天气更暖和。缺了对照所有的感觉有效都只是错觉的候选项不是证据。在这篇论文之前行业里评测AI助理的方式几乎都是一次性打分给一个任务看它答得对不对然后换下一个任务。这种打分方式压根没法回答它是不是从上一次交互中学到了东西这个问题因为每次测试都是孤立的快照没有把时间线拉起来看。而已有的一些记忆类评测比如 LongMemEval、LoCoMo虽然会测试跨会话的记忆能力但它们通常只关注一种记忆机制没有同时控制模型、框架这两个变量也没法把记忆确实被写入并被正确使用这件事拆解出来单独检验。PAST-Bench 想干的事就是把这条时间线真正建立起来并且用严格的对照实验把到底是谁的功劳这件事说清楚。核心设计把每个任务变成一个侦探剧PAST-Bench 的评测单位不是单个任务而是一个任务家族**任务家族**一组共享同一条隐藏规则、同一套可复用流程或同一次纠错事件的有序会话序列前面的会话给AI机会存下经验后面的会话检验它是否真的用上了这段经验。具体流程是这样的。每个任务家族里有若干个角色不同的回合冷启动回合测试AI在完全没有先验知识时的表现。学习回合让AI有机会把某条规则、某个流程或某个修正结果存进它的持久化系统。评估回合隔了一段时间之后用一个全新的、干净的会话去问它相关问题但是刻意把提示词里那些能让AI偷懒的关键触发词去掉逼它必须真的去调取存过的东西才能答对。控制回合这是整套设计里最讲究的部分专门用来堵住AI蒙对了的可能性。而且关键一点是每一个回合都发生在一个全新的会话里上下文彻底清空。这一点非常重要因为如果研究者允许AI在同一个长对话窗口里一路记着前面聊过的内容那这压根不叫跨会话学习只是普通的上下文记忆而已跟人类靠短期记忆记住五分钟前说过的话没什么本质区别。这就好比考试作弊检测。如果你允许学生把上一场考试的卷子带进这一场考场翻看那这场考试根本测不出他是不是真的学会了那只是抄卷子的能力。PAST-Bench做的事情就是把卷子彻底收走只留一张空白的新卷子然后看学生能不能凭着记忆里真正内化的知识答对题——如果他答对了那功劳只能归于记忆里真的留下了什么没有别的解释可以蒙混过关。对照回合具体分四种类型一种是彻底抹掉前面存的状态看AI是不是真的会因为缺了这些信息就答不出来一种是塞进一些看起来相关但其实无关的干扰信息检验AI会不会被似是而非的东西带偏一种是故意留下过时的、已经被更新掉的旧记忆测试AI会不会误用过期信息还有一种是故意提供错误的技能或错误的证据来源看AI会不会误入歧途。这四种控制加在一起就是为了让最后测出来的进步分数经得起质问这个提升真的不是走捷径、不是碰巧记对了、不是用了错误的方法蒙对答案吗四种能力维度从记住一句话到推翻一个旧结论PAST-Bench 把要测的能力拆成了四个维度一共设计了26个场景、204个具体的任务回合。第一个维度是**记忆****记忆能力**测试AI能否记住并在恰当时机应用一条日常性质的、大概率不会再变的规则比如用户的偏好、限制条件、或者之前处理过的一个类似案例的结论。这类任务的关键设计是一次性写入、永不修改。AI只需要学会一件事在提示词里那个明确的触发词被拿掉之后还能不能想起这条规则并且套用上去。这里注意的是什么时候该主动去查这条记忆这件事被留到了第三个维度里单独测这一维度只测记不记得住、拿不拿得出来用。第二个维度叫**流程复用****流程复用能力**测试AI能否记住一整套多步骤的专业操作流程并且在之后的任务里正确地按顺序重新执行它而不只是记住某个孤立的知识点。这一类任务比记忆维度要求高得多因为它测的不是知道什么而是会不会做。研究者专门设计了跳步、顺序错误、用错工具这几种失败判定任何一种都会被记为失败。这个区分很像开车和背交规的区别。你能背出红灯停绿灯行不代表你真的会开车你得记住整套操作顺序踩离合、挂挡、松刹车、看后视镜顺序错了或漏了一步车照样开不出去甚至更危险。流程复用测的就是这种整套动作能不能被完整复现的能力而不是单点知识的对错。第三个维度是**信息收集****信息收集能力**测试AI在答案其实已经存在于系统某处比如历史会话记录或已注册的技能库的情况下能不能在恰当的时机主动去查询它而不是靠猜或者靠一个看似合理但实际错误的默认答案糊弄过去。这个维度非常有意思因为它测的其实是一种主动性而不是记忆力。研究者故意在系统里埋了一个看起来靠谱但其实是错的通用默认答案如果AI偷懒不去检索直接套用这个默认答案就会答错。这就像图书馆场景。资料明明就摆在书架上可如果你懒得走过去翻只凭自己脑子里的模糊印象随口一答很可能给出一个听起来合理但实际错误的答案。有没有主动走一趟检索的动作直接决定了答案的可靠性。信息收集能力测的正是这个愿不愿意多走一步的习惯。第四个维度是**更新****更新能力**测试当系统里存在一条旧信息比如过期的事实、旧规则或临时豁免条款后续又出现了一个权威的、带纠正性质的新写入时AI能不能正确地切换到新信息同时确保旧信息不会渗漏出来影响判断。这是四个维度里最考验系统设计的一个因为它同时测了接受新东西和彻底忘掉旧东西两件事缺一不可。主实验发现进步是真的但每个模型的擅长点完全不同研究团队跑了七个不同的基础模型包括 GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.6、DeepSeek-V4-Pro、GLM-5.1、Kimi K2.6、MiniMax-M2.7和四种不同的智能体框架把 Hermes 固定不变只换底层模型得到了下面这张关键成绩单。| 模型 | 记忆 Δ | 流程 Δ | 信息 Δ | 更新 Δ | 总体 Δ ||---|---|---|---|---|---|| GLM-5.1 | 0.23 | 0.09 | 0.11 | **0.36** | 0.20 || Kimi K2.6 | **0.33** | 0.03 | 0.05 | 0.27 | 0.17 || DeepSeek-V4-Pro | 0.33 | 0.12 | 0.06 | 0.18 | 0.17 || MiniMax-M2.7 | 0.26 | 0.05 | 0.09 | 0.12 | 0.13 || GPT-5.4 | 0.37 | **0.19** | 0.07 | 0.34 | **0.24** || Claude Sonnet 4.6 | 0.32 | 0.10 | 0.10 | 0.29 | 0.20 || Claude Opus 4.6 | 0.26 | 0.14 | 0.06 | 0.28 | 0.19 |这里的 Δ 值代表打开持久化记忆功能相比关闭持久化记忆功能之后分数的提升幅度数值越高说明持久化记忆的加成越明显。七个模型全部都是正数这说明持久化确实有用不是安慰剂效应。但更有意思的是每个模型提升最多的维度完全不一样。GPT-5.4几乎均匀地在记忆和更新两个维度上进步GLM-5.1把将近一半的进步都砸在了更新维度Kimi K2.6反倒是把接近一半的进步放在了记忆维度。**一个模型本来就擅长什么持久化记忆往往就在那个方向上帮它更多**这说明单看一个笼统的总体提升分数其实是有误导性的它把四种完全不同性质的能力硬揉成了一个数字掩盖了模型之间真实存在的差异。这就好比给一个班的学生统一算个综合成绩看起来公平但实际上完全看不出来谁数学强谁语文强这个平均分对因材施教毫无帮助。再看框架维度的对比固定住 MiniMax-M2.7 这个模型换四种不同的智能体框架| 框架 | 记忆 Δ | 流程 Δ | 信息 Δ | 更新 Δ | 总体 Δ | 机制证据分 ||---|---|---|---|---|---|---|| nanobot | 0.06 | –0.06 | 0.13 | **0.37** | 0.13 | 0.57 || ZeroClaw | **0.29** | –0.04 | 0.08 | 0.15 | 0.12 | 0.55 || Agent-Zero | –0.27 | 0.11 | –0.01 | –0.13 | –0.08 | 0.39 || Hermes | 0.26 | 0.05 | 0.09 | 0.12 | 0.13 | 0.64 || **Hermes**本文提出 | 0.27 | –0.02 | 0.12 | **0.24** | **0.15** | **0.73** |这张表暴露出一个非常关键的问题nanobot 和 Hermes 的总体 Δ 都是 0.13看起来打了个平手。但如果去看机制证据分这一列nanobot 只有0.57Hermes 有0.64。**同样的分数提升背后可能是完全不同的实现路径**nanobot 之所以能拿到 0.13靠的几乎全是更新维度那一个方向单独发力而且缺乏先写入再读取这种一致的证据链。也就是说它可能是靠某种运气或者捷径拿到的高分而不是真正走完了保存经验、检索经验、正确使用经验这条完整链路。什么是机制证据分为什么它比原始分数更重要这里必须停下来解释一下 Mech 分数到底在测什么因为它是整篇论文里最有巧思的设计之一。**机制证据分Mechanism-Evidence ScoreMech**一个综合指标用来衡量AI在获得任务分数提升的同时是否真的走了预期中的写入、检索、正确应用这条数据流通路而不是靠其他方式蒙对了答案。它由五个子分数加权组成写入精确度学习阶段有没有把正确的内容存下来、召回准确度评估阶段是不是真的调用了预期的检索信号才拿到正确内容、更新正确性新旧信息切换是否干净、保留跨度远距离的评估任务和近距离的评估任务表现差多少、以及污染率学习阶段是不是写入了很多无关的垃圾信息这个越低越好。为什么需要这么复杂的一套东西而不是直接看任务分数就完了因为任务分数只能告诉你结果对不对没法告诉你这个结果是怎么来的。一个AI可能写入了正确的记忆但从来没读取过靠的是模型本身的推理能力蒙对了答案这种情况下任务分数照样很高但它压根没有用上持久化记忆这套系统你如果只看任务分数会误以为持久化机制发挥了作用实际上它是无关的旁观者。这就好比一个学生数学考了满分你不知道他是真的把公式推导过程理解透了还是提前拿到了标准答案背下来的。两种情况下卷面分数一模一样但背后的能力储备完全不同一旦换一道稍微变形的题目两者的表现马上就会分道扬镳。机制证据分做的事就是想办法去看这个学生的草稿纸检查他是不是真的用了推导过程而不只是看最后写在答题卡上的数字。论文特别指出为了让这个 Mech 分数不是研究者自说自话他们专门找了两位作者独立地、在完全不知道模型身份、框架、分数、评分条件的情况下重新给48个抽样案例打分结果人和人之间打分的一致率高达83.3%人和LLM裁判之间打分完全一致的比例是68.8%如果放宽到0.25分以内的误差算一致一致率能到91.7%。这说明用LLM来自动打这个复杂的机制分数虽然不完美但是可信的。诊断出五个具体病灶然后对症下药Hermes研究团队没有止步于给现有系统打分他们进一步去翻看那些进步不明显或者进步不均匀的运行记录试图找出具体是哪个环节出了问题。他们发现的问题非常具体一共归纳出五类制定计划的时候根本没有先去查一下已经存好的状态草稿动作直接就提交执行了保存下来的事实格式太乱新旧信息混在一起下一次会话很难分清哪个才是当前有效的辛辛苦苦跑通的一套工作流程最后却只留在对话记录的文字里没有变成一个真正可以被再次调用的技能文件面对需要先查证据再行动的任务AI经常图省事直接跳过查证据这一步凭当前可见的上下文硬答纠正之后的新信息没能真正地覆盖掉旧记录导致后续会话读到的还是旧数据。针对这五类问题研究者在 Hermes 的基础上加了五个对应的干预机制构成了 Hermes**Hermes**在原版 Hermes 智能体框架基础上针对性地在agent执行循环的五个不同阶段插入五个独立机制的改进版框架分别对应计划、渲染、路由、门控、收尾五个环节。第一个机制叫 E1加在计划阶段强制AI在起草任何有风险或依赖记忆的动作之前必须先去查一下当前可用的持久化状态把计划建立在这个基础之上这是一个跨维度通用的检查点不针对某个特定能力。第二个机制叫 E2加在渲染阶段把记忆存储的格式规范成一种带类型的绑定结构包含类型、作用域、实体、当前值、被替代的旧值、过期时间这些字段然后在渲染给下一次会话看的时候只展示当前有效的那一条把过期的记录隐藏起来不让它干扰判断。这个设计思路可以类比一下你手机里的联系人备注。如果你把某个朋友的旧手机号和新手机号都记在同一条备注里混在一起没有标注哪个是最新的下次你想打电话的时候大概率会犯错拨错号码。而如果通讯录软件设计成只显示当前有效号码这一个字段旧号码自动归档隐藏你出错的概率就会大幅下降。E2要解决的正是这种新旧信息打架的问题如果不这么设计代理很容易在两条相互矛盾的记录里选错。第三个机制叫 E3加在路由阶段把成功跑通的流程存成一份带有适用条件和分步步骤的、可查询排序的技能文件而且要求AI在流程发生变化的时候优先去修补最接近的已有技能而不是重新造一份几乎一样的新技能造成冗余。第四个机制叫 E4加在门控阶段如果一个任务本质上依赖之前存下的状态但AI还没有做过任何检索动作就想直接给出答案这个机制会拦下这个草稿答案强制它先去做一次检索。第五个机制叫 E5加在收尾阶段在每个会话结束的时候主动去提取出最终生效的那个绑定关键字或者更新后的规则把它写成新的权威版本去替换掉旧版本并且同步刷新到持久化存储里确保下一次全新的会话读到的只有最新的那一份不会跟旧版本混在一起。单机制消融实验验证每个补丁都打在了正确的位置上光设计出来还不够研究者还专门做了消融实验把每个机制单独拿出来加到 Hermes 上其他部分保持不变看看它是不是真的只对它设计瞄准的那个能力维度起作用。| 设置 | 记忆 w/ | 流程 w/ | 信息 w/ | 更新 w/ | 总体 w/ | 总体 Δ ||---|---|---|---|---|---|---|| 原版 Hermes | 0.77 | 0.55 | 0.71 | 0.62 | 0.66 | 0.13 || E1 计划检查 | 0.73 | 0.44 | 0.68 | 0.62 | 0.62 | 0.14 || E2 记忆绑定 | **0.80** | 0.30 | 0.71 | 0.57 | 0.60 | 0.13 || E3 技能生命周期 | 0.46 | 0.47 | 0.75 | 0.35 | 0.51 | 0.12 || E4 检索门控 | 0.63 | 0.43 | **0.78** | 0.37 | 0.55 | 0.17 || E5 收尾刷新 | 0.49 | 0.33 | 0.69 | **0.70** | 0.55 | 0.12 || Hermes全开 | 0.78 | 0.38 | 0.73 | 0.74 | 0.66 | **0.15** |结果非常清晰地对上了预期E2单独加进去记忆维度的分数达到全表最高的0.80E3单独加进去流程维度的提升幅度是单机制里最大的E4单独加进去信息收集维度的分数是全表最高的0.78E5单独加进去更新维度的分数和提升幅度都是全表最高的0.70和0.16。这就好比修车你换了个新的火花塞然后专门测试点火系统发现点火确实变顺畅了而不是随便测试一个完全不相关的部件比如刹车片却发现毫无变化。每个零件的效果都精确地体现在了它该起作用的地方这说明研究者对故障原因的诊断是准确的。不过全部机制一起打开之后也就是完整版 Hermes流程维度反而出现了轻微的下滑从原版的0.55掉到了0.38。研究者进一步做了一个聚焦的交互诊断专门针对流程复用维度把 Hermes里的机制逐个拿掉再测一遍拿掉E2之后流程维度的提升幅度反而从0.085涨到了0.108但是拿掉E3或者E5提升幅度反而会下降到0.062或者0.042。这说明E2和E3之间存在某种冲突E2倾向于把信息存成结构化的绑定记录这跟E3想要的独立可查询的技能文件这种存储形式产生了竞争两者在抢夺同一份经验应该被存放在哪里。**不同的持久化机制之间不是简单地叠加就一定会更好**它们有可能互相打架抢占同一份经验的归属权。这就好比一个家庭里如果爸爸妈妈都想主导孩子的教育方式但用的是两套完全不同的育儿理念孩子反而会无所适从教育效果可能还不如只有一方主导来得稳定。多套机制共存的时候谁该管什么、谁该让位这本身就是一个需要专门设计的问题不是简单地把好东西都塞进去就完事了。跨模型迁移测试好用的补丁能不能带到别的模型上Hermes这套机制是在 MiniMax-M2.7 这个模型上调出来的那换到别的模型上还灵不灵| 模型 | 记忆 Δ | 流程 Δ | 信息 Δ | 更新 Δ | 总体 Δ | 机制分 ||---|---|---|---|---|---|---|| DeepSeek-V4-Pro | 0.42 | 0.04 | 0.01 | 0.13 | 0.15 | 0.69 || MiniMax-M2.7 | 0.27 | –0.02 | 0.12 | 0.24 | 0.15 | 0.73 || GPT-5.4 | 0.41 | 0.18 | 0.06 | **0.31** | **0.24** | **0.80** || Claude Sonnet 4.6 | 0.33 | 0.17 | 0.05 | 0.33 | 0.22 | 0.77 || Claude Opus 4.6 | 0.27 | 0.07 | 0.07 | 0.33 | 0.18 | 0.70 |跟原版 Hermes 的基线相比Hermes在 MiniMax-M2.7、Claude Sonnet 4.6、GPT-5.4 这三个配置上都追平或者超过了原来的表现在 GPT-5.4 上甚至打平了整个实验里的最高分记录。但在 DeepSeek-V4-Pro 和 Claude Opus 4.6 上出现了轻微的倒退。论文对这一点非常坦诚直接说这是一个诊断性脚手架不是万能药方。而且他们专门跑了三次重复实验来检验这个提升到底稳不稳结果发现整体的Δ提升从原版Hermes的0.13变成 Hermes的0.15这个0.02的差距比三次重复实验之间自身的波动幅度还要小。也就是说如果单看这个总体数字这个提升在统计上其实站不住脚不能说是一个稳定可靠的整体进步。但是拆开来看更新这一个维度单独的表现从原版的0.12提升到 Hermes的0.24这个差距就明显超过了波动范围是一个真实存在的进步。这也再一次印证了前面反复强调的那个观点笼统的总分经常会把真正有意义的局部进步给平均掉、给掩盖住。论文之后还留下了什么没解决的问题研究者自己也很清楚这套体系还不完美专门列了几条未来可以扩展的方向。现在这204个任务全部是人工合成的场景跟真实用户长期使用中积累出来的、跨领域交叉污染的复杂情况相比还是简化了很多未来需要引入真人产生的交互数据、更长的任务链条以及测试一个领域学到的经验会不会干扰另一个领域的判断。现在测的四个能力维度记忆、流程复用、信息收集、更新只是自我进化这个大命题里最基础的几块砖还没有触及到更高阶的能力比如AI能不能自己发明出之前从未见过的工具使用策略能不能自主构建和修正长期规划能不能在多个智能体之间共享和协调经验。现在的机制证据分测的是符合预期路径的一致性而不是真正意义上的因果证明未来更理想的做法是引入反事实干预比如故意删除或者篡改某个候选的持久化记录然后观察AI的行为会不会因此发生变化这样才能真正证明是这份记忆导致了这个结果而不只是这份记忆和这个结果恰好同时出现。QA**Q1PAST-Bench是用来测试什么的**APAST-Bench是一个专门检验AI个人助理能否通过保留跨会话经验实现自我提升的评测基准覆盖记忆、流程复用、信息收集、更新四种能力共26个场景204个任务通过对比打开持久化记忆和关闭持久化记忆两种条件下的表现差异来判断AI是否真的从过去的交互中学到了东西而不只是看起来学到了。**Q2Hermes和普通的Hermes框架有什么区别**AHermes是研究者针对诊断出的五类具体失败问题在Hermes智能体循环的五个阶段分别加入的针对性改进机制包括计划前检查、结构化记忆渲染、技能生命周期管理、检索门控、以及会话收尾刷新整体上把机制证据分从0.64提升到了0.73在更新维度的提升最明显。**Q3机制证据分和任务分数有什么不同为什么两个都要看**A任务分数只看结果对不对机制证据分看这个结果是不是真的通过写入、检索、正确应用这条预期路径得到的。论文发现有些AI框架任务分数提升和别的框架一样高但机制证据分却明显更低说明它们可能是靠捷径或者蒙对答案拿到的高分并没有真正用上持久化记忆系统。
返回列表