
2025 年无疑是 Agentic RL 的“混战元年”。这一年从零到一做了很多尝试认知也在不断刷新这一篇不是严谨的博客或笔记分享都只是当下的想法。LLM 很有意思的一点是3个月/6个月/12个月整个领域的认知就会快速变化非共识的诞生到共识的时间很短可以快速验证自己过去某个时间节点的暴论是否成真极大满足了 N 人的思考-验证快乐也是一种训练自己的 RL。因此在新年开始前试图总结去年的部分实践和衍生认知都是不负责任的暴论等到 2026 年底再回看是否有一些别样滋味。一、中间形态和降维打击今年很多 Paper 和 Tricks 可能都只是 RL 初期的产物本质都是因为特定根本问题没解决的时候打补丁方案或是为了加速训练而牺牲上限的妥协。Patch vs. Solution比如花哨的 Cold Start/Curriculum Learning/Specific PRM 策略本质上多是为了解决 Sparse Reward 和 Unstable 的问题。一旦后两者有了更本质的解法前者无论设计得多么精巧都将被瞬间“降维打击”不针对任何人包括我自己在内大家都要混口饭吃难免还要在此多做些工作。好在走到那个未来之前毕竟现在的策略还都处在 naive 阶段还有大量坑可以实践出真…moe training/credit assignment/multi-agent rl/exploration strategy/generalizable reward model/process reward。相比之下有两个被提得较少、但对 RL 泛化和效率至关重要的方向用于更新梯度的 Trajectory Selection Trajectory Budget Assignment在有希望的 Trajectory 上的算力/时间分配。这是 RL 区别于 SL 的特有问题。二、MDP vs. POMDPMDP 只是 Toy Task 里的童话Episode MemoryPOMDP 才是现实世界。Context Management关于上下文Manus 的 Append-onlyKV Cache策略确实很适合应用侧。模型侧训练时经过这么久一系列 Sliding Windows/Summary/File Offload 的折腾后我感觉就算存在一种“完美策略”也只能延缓 Context 相对增长的速度而无法根本解决复杂任务下的无限上下文问题。Save-Load 大法所以回到本质解法回想人类工作很少是从头到尾一口气做完的。本质上Agentic RL Rollout 学习的应该是不同长度的 Episodic 阶段性任务和组合Query/State 为前一个 Episode 的产出而不是每次都从头执行到尾。这样一来产生新问题转化为如何合理定义 Milestone 并切分 Episode —— 用游戏术语说就是学会“Save-Load 大法”。三、Scaling Law 下半场环境即一切和 Pretrain 时代一样Agentic RL Scaling Law 的上半场卡点是高效基建异步、offpolicyness 等老生常谈就不多说了【AgentRL】工业级 Agentic RL 训练对比选型指南数据RL Context 下对应的是 Env 而不只是 Seed Query 和 trajectory。但下半场则是 Env 自动化和泛化能力的双向飞轮核心几家大厂可能已经走到这一步了。Low Hanging FruitCode Sandbox、Search 等相对统一、无限的环境配合预训练中充分的 RAG/Code 背景知识是目前价值最高且大家都在卷的方向。但大多数垂域长尾工具API不仅统一难构建训练环境更难。MCP 协议目前的开放度还不足以形成统一生态。Generative Environment因为 2碎片化的模拟环境构建速度跟不上 RL 日益增长的泛化需求成了主要矛盾对应 RL 时代有 OpenAI Gym/Mujoco/ProcGen当下似乎还缺少类似的可信生成式环境。LLM as Env在 vibe coding/aigc 高度发达的时代能够以相对统一的方式自行根据描述产生相应的 env 代码或界面并作出反馈是完全可预期的方向。更直接的则是 LLM/VLM as EnvLLM/VLM 本身就是最好的通用环境给出虚拟 Result/Traceback许多模拟用户来训练对话能力的工作本质也是如此。四、Agentic RL 泛化的三个方面泛化本就是 RL 的难点更不用说 Agentic RL 这类超广域任务。初步看Generalizable RL 可能会有几个阶段工具泛化能够通过阅读说明书Context学会操作未见过的工具即便形态、命名或版本发生变化。随着数据和环境 Scaling这一层难度可能不大。场景泛化需要充分理解模块化技能的组合效用即使场景外在表现形式发生变化。当开源生态社区的技能组合和其他领域的知识沉淀足够丰富面向AI的说明书足够多时如 Anthropic 的 skills.md这种迁移能力终将推向 AGI。模态泛化文本模型的行动力迁移到全模态类比人类通过全模态感知并执行结果。也许会有很多细粒度改良 trick 的RL 算法昙花一现也许其实是大概率手头的工作都会成为时代的眼泪和弯路也许接下来会有一年左右“领域模型 vs. 泛化模型”的中间态之争。但好在大家终于都开始相信终局 AGI 会卷走一切于是眼前的一切都还在 garner 曲线的上升期。于我而言跌宕的 2025 也终于过去了不知道有没有更加跌宕的 2026害怕走弯路和歧途却避免不了不断的随机或稀疏的 reward/penalty、POMDP、env shift。人生只是一个没有回头路的单线程 rollout RL未来涌现在无数弯路之中。最后唠两句为什么AI大模型成为越来越多程序员转行就业、升职加薪的首选很简单这些岗位缺人且高薪智联招聘的最新数据给出了最直观的印证2025年2月AI领域求职人数同比增幅突破200% 远超其他行业平均水平整个人工智能行业的求职增速达到33.4%位居各行业榜首其中人工智能工程师岗位的求职热度更是飙升69.6%。AI产业的快速扩张也让人才供需矛盾愈发突出。麦肯锡报告明确预测到2030年中国AI专业人才需求将达600万人人才缺口可能高达400万人这一缺口不仅存在于核心技术领域更蔓延至产业应用的各个环节。那0基础普通人如何学习大模型 深耕科技一线十二载亲历技术浪潮变迁。我见证那些率先拥抱AI的同行如何建立起效率与薪资的代际优势。如今我将积累的大模型面试真题、独家资料、技术报告与实战路线系统整理分享于此为你扫清学习困惑共赴AI时代新程。我整理出这套 AI 大模型突围资料包【允许白嫖】✅从入门到精通的全套视频教程✅AI大模型学习路线图0基础到项目实战仅需90天✅大模型书籍与技术文档PDF✅各大厂大模型面试题目详解✅640套AI大模型报告合集✅大模型入门实战训练这份完整版的大模型 AI 学习和面试资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】①从入门到精通的全套视频教程包含提示词工程、RAG、Agent等技术点② AI大模型学习路线图0基础到项目实战仅需90天全过程AI大模型学习路线③学习电子书籍和技术文档市面上的大模型书籍确实太多了这些是我精选出来的④各大厂大模型面试题目详解⑤640套AI大模型报告合集⑥大模型入门实战训练如果说你是以下人群中的其中一类都可以来智泊AI学习人工智能找到高薪工作一次小小的“投资”换来的是终身受益应届毕业生无工作经验但想要系统学习AI大模型技术期待通过实战项目掌握核心技术。零基础转型非技术背景但关注AI应用场景计划通过低代码工具实现“AI行业”跨界。业务赋能 突破瓶颈传统开发者Java/前端等学习Transformer架构与LangChain框架向AI全栈工程师转型。获取方式有需要的小伙伴可以保存图片到wx扫描二v码免费领取【保证100%免费】