尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

从长期记忆中持续沉淀技能!国产开源Agent记忆框架夯爆了

从长期记忆中持续沉淀技能!国产开源Agent记忆框架夯爆了 今天Agent 已经不只是在对话框里给出一个答案。它们可以在代码库、浏览器和各类工具之间持续工作把原本零散的操作串成一段更完整的任务流程。但任务一旦跨了好几天、好几个工具真正棘手的事就出现了同样的问题再来一次它能不能少走弯路很多系统已经有长期记忆能存下聊天记录、工具调用、任务总结和复盘。可“存下”不等于“学会”。比如Agent 可能记得自己装过一个插件下次却还是重新翻目录、再试一遍。它也可能留下很多代码修改记录却不知道哪些做法真的有效又分别适用于什么条件。问题不一定是记录不够多而是这些记录还没有变成一套能在合适场景里拿出来用、并且能自己说明为什么可用的办法。任务越长这个缺口越明显——反复试错会消耗时间也让结果变得不稳定。这正是记忆张量MemTensor 团队联合中国科学技术大学、香港理工大学、福州大学和西安交通大学的研究人员提出 **MSCEMemory-Skill Co-Evolution**的切入点。它不只把长期记忆当作可检索的历史文本而是希望让系统从一次次交互里挑出可信的经验再把它们整理成可复用的策略和技能。换句话说MSCE 要解决的不是“怎样多记一点”而是“记住以后怎样真的学会”。论文题目From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents论文链接https://arxiv.org/pdf/2607.16621github链接https://github.com/MemTensor/MemOS01一段经历什么时候才值得留下如果把聊天记录、工具返回和操作轨迹都塞进长期记忆Agent 的确“记得更多”了。但它下一次做事时还是得把这些材料重新读一遍、重新判断一遍。这很像把一整本工作日志交给新人东西不少却没有告诉他哪一页才是真正能照着做的经验。更难的是分辨。一条任务成功了可能是方法对了也可能只是碰巧遇到了合适的环境。一条失败记录里也可能藏着一个本来正确、只是没走完的步骤。要是把原始轨迹直接固化成技能试错、偶然性和只适合当时环境的细节也会一起被带到下一次任务里。所以 MSCE 不把“多存一点”当作答案。它先问三个更具体的问题哪些经验值得留哪些做法可以抽出来复用以及一条策略满足什么条件才够资格变成技能。02论文把记忆分成了三层MSCE 的做法是先别把所有信息混在一个记忆池里。研究团队把它们拆成 L1、L2 和 L3 三层每一层只回答一个问题。L1 先记事实刚才到底发生了什么它保留任务当时的状态、Agent 做了什么、环境给了什么反馈、这一步的局部反思以及经过反馈校准后的轨迹价值。L1 不会急着下结论它更像一份能回头查的原始记录。L2 再整理做法遇到这类问题通常该怎么处理当不同 episode 里反复出现相似、而且结果为正的轨迹时MSCE 会把它们归纳为一条结构化策略。里面不只写操作步骤还要写清触发条件、验证条件、不适用的边界以及这条策略来自哪些轨迹和 episode。例如智能体在多个软件环境中反复发现“基础镜像缺少系统依赖仅安装 Python 包无法解决问题”这就不再只是一条操作经验而可以上升为对环境依赖关系的认知。L3 则往前走一步试着回答这个环境有什么规律如果多条 L2 策略总在同一个领域出现系统会继续整理这里的实体、结构、工具依赖和任务约束并把相关策略留在一起。例如智能体在多个软件环境中反复发现“基础镜像缺少系统依赖仅安装 Python 包无法解决问题”这就不再只是一条操作经验而可以上升为对环境依赖关系的认知。可以这样理解L1 记下发生过什么 → L2 整理下次怎么做 → L3 归纳环境里的规律。把这三件事分开后面的技能才有证据可查。03任务做完后怎样看待中间的每一步长任务常常只有一个最终结果完成或者没完成。可一个任务做成了不代表前面的每一步都对做砸了也不代表每一步都没有价值。只拿最后的成败给整条轨迹打分很容易把真正有用的操作和无效试错混在一起。MSCE 设计了一套**“反思加权的价值回填”**办法。任务结束时最终反馈先确定终点的价值再往前看系统会把每一步的局部反思和后续步骤的价值结合起来。某一步的反思越可靠它越能继承最终反馈判断不清时就更多参考后面发生了什么。对于文本反馈MSCE 还会看目标完成度、执行过程质量和用户满意度合成一个统一的终局信号。这样一条轨迹里的步骤不必再拿同样的分数真正推动任务往前走的操作会被保留反复无效的探索会被压低。04从一次经验到一项真正能用的技能在 MSCE 里完成一次任务不等于自动多出一项技能。研究团队把技能看成从稳定 L2 策略里筛出来的可调用对象。一条策略得有明确证据支撑、带来过正向收益、适用范围足够稳定还要通过验证才会被提升为技能。这也意味着技能不能只写“该做什么”还得写“什么时候别做”。系统会检查里面的工具、步骤和结论有没有证据验证条件是否完整以及它有没有偷偷加入证据里从没出现过的工具或能力。最后形成的技能会带着触发器、执行过程、验证规则、适用边界、证据锚点、决策指导和可靠度。它也不是生成后就不再变化候选、试用、激活、修正、归档都是它可能经历的状态。连续成功的技能会被强化反复失败或得到负面反馈的适用范围会收缩甚至不再默认被检索。05两组评测结果怎么样研究团队把 MSCE 放到两类测试里看。EvoAgentBench 覆盖信息检索、数学推理、软件工程、代码实现和知识工作五类 Agent 任务LoCoMo 则专门考察长对话记忆。先看前一组。和各领域最强的非 MSCE 基线相比MSCE 在信息检索、数学推理、软件工程和知识工作上的 Pass1 分别提高 4.61、4.00、15.39 和 5.17 个百分点。代码实现任务里它以 61.54% 的 Pass1 并列最佳平均交互轮数从 3.9 降到 2.0。再看 LoCoMo。MSCE 的总体评审得分是 61.23总体 F1 是 49.89比最强基线 SkillFlow-Evolve 分别高 2.01 和 1.18 分。结果显示除软件工程外它在多数任务里同时改善了效果和效率软件工程的成功率涨得明显成本则小幅上升。06离开原任务这套方法还管用吗一条技能如果只能在第一次学到它的任务里生效价值有限。研究团队又测了六组跨领域迁移信息检索到数学推理、数学推理到代码实现、代码实现到软件工程以及知识工作到信息检索等。六组迁移都带来了正向的 Pass1 增益幅度在 2.56 到 5.13 个百分点之间平均是 3.93 个百分点其中四组的任务成本还降了。至少从这组实验看MSCE 留下的不是某一道题的标准答案而是能换个场景继续用的操作结构、验证方式和环境认识。同时还观察了一个更长的过程从 p0 到 p100记忆和技能不断积累以后信息检索、数学推理和软件工程的 Pass1 都持续上升。单位成功任务的归一化成本先因探索而上升之后再慢慢回落。07记忆不该只是档案做 Agent 记忆常见的思路是两件事多记一点或者检索得准一点。MSCE 追问的是第三件事记起来之后怎样把经验变成下次还能用、出了问题也能改的能力在这套框架里轨迹不只是日志而是证据策略不只是一次总结而是带着触发器、边界和验证条件的程序环境认知不只是模型的自由联想而是和策略、轨迹相连的结构化信息。技能也不是临时写出的一句提示词它有来处、有可靠度也会经历试用、修正和归档。所以这篇论文真正想处理的不是给 Agent 多加一点存储空间而是让它对自己做过的事有更好的记性也有更谨慎的判断什么该相信什么能复用什么还需要继续改。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表