尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

MSCE 填补 Agent“记得”与“会做”空白,多评测表现优且跨领域迁移能力强

MSCE 填补 Agent“记得”与“会做”空白,多评测表现优且跨领域迁移能力强 01 Agent 能记住不等于下次会做历史记录能帮 Agent 想起过去却不能保证它下一次真的会按正确方法做。MSCE 想补上的正是“记得”和“会做”之间的这段空白。Agent 已不只是在对话框里给出一个答案它们会进代码库找文件、打开浏览器查资料、调用工具继续往下做。但随着任务变长问题也随之而来隔几天再遇到类似问题它能不能少走弯路这正是记忆张量 MemTensor 联合中国科学技术大学、香港理工大学、福州大学和西安交通大学的研究人员提出 MSCEMemory - Skill Co - Evolution的切入点。它不只把长期记忆当作可检索的历史文本而是希望让系统从一次次交互里挑出可信的经验再把它们整理成可复用的策略和技能。换句话说MSCE 要解决的不是“怎样多记一点”而是“记住以后怎样真的学会”。02 一段经历什么时候才值得留下如果把聊天记录、工具返回和操作轨迹都塞进长期记忆Agent 的确“记得更多”了。但它下一次做事时还是得把这些材料重新读一遍、重新判断一遍。这就像把一整本工作日志交给新人内容不少却没告诉他哪一页才是真正能照着做的经验。更难的是分辨。任务成功了不一定是方法真的对也可能只是当时的环境刚好配合。任务失败了也不代表整条路径都错了里面可能有一步本来是对的只是没来得及走完。如果不做筛选直接把原始轨迹固化成技能试错过程、偶然条件甚至只适用于那一次任务的细节都会被一起打包带走。下一次复用的可能不是经验而是上一次留下来的偏差。MSCE 不把“多存一点”当作答案它先问三个更具体的问题哪些经验值得留哪些做法可以抽出来复用以及一条策略满足什么条件才够资格变成技能。03 这不是三层笔记而是三套不同的更新规则MSCE 没有把所有信息塞进同一个记忆池而是将其拆分为 L1、L2 和 L3 三层。三层记忆不仅承载的内容不同写入与更新机制也各不相同。L1 是证据层。一条 L1 不是一句事后总结而是一组“状态、动作、观察、局部反思、价值”的决策单元。最后这个价值在任务结束前并不存在系统先把轨迹留住等 episode 的终局反馈到来再回填到具体步骤。为了控制存储和隐私风险L1 保存的是归一化证据——截短的状态文本、动作文本、结构化工具元数据和受限的工具输入输出L2、L3 只保留这些证据的 ID不再复制原始记录。L2 才是“做法”层但也不是见过一次就归纳。在 MSCE 中只有步骤价值达到阈值 v_min 的 L1 证据才会进入策略抽取。系统先通过向量相似度检索近邻再核对领域标签、工具类型和归一化后的错误签名。若匹配到已有策略新证据将用于更新该策略。若没有匹配项则进入按确定性模式签名划分的候选池。只有同一候选桶里至少积累了来自 n_min 个不同 episode 的证据系统才会归纳出一条新策略。每条 L2 策略都包含触发条件、执行过程、验证或回退方式、适用边界和支撑证据。进一步引入“策略增益” G用于衡量策略的有效性。它比较使用该策略的轨迹平均价值与同一评估池中未使用该策略轨迹的混合基线。G 并非严格意义上的因果效应而是用于决定策略继续保留、进入技能候选或被退役的启发式信号。L3 则不再写“下一步怎么做”而是抽取环境事实、动作——响应规律和约束条件。L3 试着回答这个环境有什么规律如果多条 L2 策略总在同一个领域出现系统会继续整理这里的实体、结构、工具依赖和任务约束并把相关策略留在一起。例如智能体在多个软件环境中反复发现“基础镜像缺少系统依赖仅安装 Python 包无法解决问题”这就不再只是一条操作经验而可以上升为对环境依赖关系的认知。算法上的分工L1 先把每一步变成可追溯证据L2 要跨 episode、过价值阈值才形成可修订策略L3 只从多条稳定策略里抽环境规律。后面的技能不是从“记忆很多”里长出来的而是从这三道筛选里长出来的。04 一个最终结果怎样分给中间的每一步长任务常常只有一个最终结果完成或者没完成。可一个任务做成了不代表前面的每一步都对做错了也不代表每一步都没有价值。只拿最后的成败给整条轨迹打分很容易把真正有用的操作和无效试错混在一起。MSCE 因此设计了一套“反思加权的价值回填”办法。最后一步直接继承终局反馈 R_i再沿轨迹往前每一步都在“终局反馈”和“下一步已经回填出的价值”之间取值。α_t 决定这一步更相信哪一边γ 则控制后续价值往前传递时的折扣。V_t α_tR_i (1 − α_t) * γV_t 1。α_t 不是按反思写得长不长来定而由一个反思评分器根据局部上下文判断这段反思是否忠实、具体、能解释因果、并且可迁移。空话、同义反复或没有证据支撑的反思权重会被压到很低甚至为零。对文本反馈MSCE 再综合目标完成度、执行过程质量和用户满意度形成 R_i。这样一条轨迹里的步骤不必再拿同样的分数真正推动任务往前走、同时能解释清楚的操作会被留下。05 从策略到技能要再过两道门在 MSCE 中完成一次任务并不会直接生成一项技能。技能需要从经过持续验证的 L2 策略中进一步筛选并转化为可被系统调用的能力单元。首先策略需要通过证据与增益检验。其支撑轨迹必须仍然有效且策略增益超过晋升阈值才有资格进入技能候选阶段。G(f(2)) θ_G。第二道门是稳定性新的近期证据要能继续吻合现有的触发条件、步骤和适用边界而不是每来一个样本就需要重写策略。通过后正向证据用来归纳共同流程反向证据不被丢掉而是用来收紧边界、写出反模式。技能因此不只回答“怎么做”也回答“什么时候别做”。真正让它不只是一次语言生成的是后面的确定性校验。系统会检查技能名称、前置条件、有序步骤、示例、工具列表和决策指导等字段是否齐全引用的证据 ID 必须来自支撑集合工具也必须出现在证据轨迹的白名单里。再通过两项轻量覆盖测试防止它编造从未出现过的命令或偏离保留下来的轨迹。任何一项失败草稿直接丢弃不进入可调用技能库。最终生成的技能包含触发条件、执行过程、验证规则、适用边界、证据锚点、决策指导和可靠度等信息。可靠度不会因单次成功直接记为 100%。MSCE 采用平滑成功率避免小样本导致结果被高估。用户纠正或拒绝会降低技能可靠度并可能收缩其适用边界。只有经过连续成功验证技能才会从试用状态进入激活状态。若多次执行失败则会被归档。η (n_pass 1) / (n_trial 2)06 两组评测结果怎么样分别在 EvoAgentBench 和 LoCoMo 上对 MSCE 进行了评测。EvoAgentBench 覆盖信息检索、数学推理、软件工程、代码实现和知识工作五类 Agent 任务LoCoMo 主要考察长对话记忆能力。先看 EvoAgentBench 的结果。和各领域最强的非 MSCE 基线相比MSCE 在信息检索、数学推理、软件工程和知识工作上的 Pass1 分别提高 4.61、4.00、15.39 和 5.17 个百分点。代码实现任务里它以 61.54% 的 Pass1 并列最佳平均交互轮数从 3.9 降到 2.0。在 LoCoMo 评测中MSCE 的总体评审得分为 61.23总体 F1 为 49.89较最强基线 SkillFlow - Evolve 分别提升 2.01 和 1.18 分。除软件工程外MSCE 在多数任务中同时提升了效果与效率。在软件工程任务中成功率提升更为明显成本则小幅增加。07 离开原任务这套方法还管用吗一条技能如果只能在第一次学到它的任务里生效价值有限。研究团队又测了六组跨领域迁移信息检索到数学推理、数学推理到代码实现、代码实现到软件工程以及知识工作到信息检索等。在六组跨领域迁移实验里Pass1 都有提升幅度为 2.56 至 5.13 个百分点平均提升 3.93 个百分点其中四组还降低了任务成本。结果说明MSCE 沉淀下来的不是某一道题的解法而是可以带到新场景里的操作结构、验证方式和环境认知。进一步观察了从 p0 到 p100 智能体的持续学习过程。随着记忆和技能不断积累信息检索、数学推理和软件工程三类任务的 Pass1 都在持续上升单位成功任务的归一化成本则在前期探索阶段有所增加之后逐步回落。08 记忆不该只是档案做 Agent 记忆常见的思路是两件事多记一点或者检索得准一点。MSCE 追问的是第三件事记起来之后怎样把经验变成下次还能用、出了问题也能改的能力在这套框架里轨迹不只是日志而是证据策略不只是一次总结而是带着触发器、边界和验证条件的程序环境认知不只是模型的自由联想而是和策略、轨迹相连的结构化信息。技能也不是临时写出的一句提示词它有来处、有可靠度也会经历试用、修正和归档。MSCE 真正想处理的不是给 Agent 多加一点存储空间而是让它对自己做过的事有更好的记性也有更谨慎的判断什么该相信什么能复用什么还需要继续改。论文与项目论文地址https://arxiv.org/abs/2607.16621 开源代码https://github.com/MemTensor/MemOS关于 MemOSMemOS 为 AI 应用构建统一的记忆管理平台让智能系统如大脑般拥有灵活、可迁移、可共享的长期记忆和即时记忆。作为记忆张量首次提出“记忆调度”架构的 AI 记忆操作系统希望通过 MemOS 全面重构模型记忆资源的生命周期管理为智能系统提供高效且灵活的记忆管理能力。
返回列表