尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Agentic Scaling 到自进化:大模型下一阶段演进路线图

Agentic Scaling 到自进化:大模型下一阶段演进路线图 摘要大模型正在从「预训练 Scaling Law」迈向「Agentic Scaling」新阶段——模型在环境交互中积累经验,在任务执行中自我修正提升。本文确认嘉宾(张俊林、俞扬、方斌、卢志武)对 Agentic Scaling、自进化、MoE 架构的判断,梳理出大模型下一阶段演进的 3 条技术路线:后训练推理计算协同(方斌)、世界模型驱动的具身推理(俞扬)、多模态统一表征下的自进化(卢志武、张俊林)。SEO关键词:Agentic Scaling / 自进化大模型 / 大模型后训练 / MoE 架构 / 推理计算协同 / 大模型演进 / 张俊林 / 俞扬 / 方斌 / 卢志武 / 2026 奇点智能大会一、为什么「Agentic Scaling」会成为本届主基调过去 5 年,大模型能力提升主要靠预训练 Scaling Law——参数、数据、算力的指数级增长带来模型能力的线性增长。但 2024 年开始,这个规律出现两个拐点:数据瓶颈:高质量文本数据即将耗尽,继续堆数据带来的边际收益迅速下降推理成本拐点 系列证明,在推理时展开大量 token 进行「思考」,能显著提升复杂任务能力本届大会把议题命名为「从 Agentic Scaling 到自进化」,正是对这两个拐点的回应——大模型下一阶段的能力提升,将主要靠推理时算力 工具调用 多步规划的协同,而非纯预训练参数堆叠。二、4 位嘉宾的判断交叉验证嘉宾学术/工业背景核心判断工程关注点张俊林新浪微博首席科学家 · 工业落地视角推荐系统与大模型结合的下一站是「多模态推荐 推理协同」亿级 DAU 场景的推理成本控制俞扬南大人工智能学院教授 · 强化学习方向Agentic Scaling 的本质是「环境交互中学习」,与强化学习一脉相承Sim-to-Real、世界模型方斌北邮拔尖人才教授 · 后训练方向下一阶段的关键是「后训练 推理计算协同」,过程奖励模型将取代结果奖励训练效率、PRM 工程实现卢志武人大高瓴 AI 学院教授 · 多模态方向真正的自进化需要「多模态统一表征」,文字之外的视觉/音频/3D 都是关键视频生成、3D 空间理解三、3 条技术路线的深度对比️ 路线 A:后训练 推理计算协同(方斌主张)核心论点:预训练已完成「知识灌注」,下一阶段要靠后训练 推理时计算把模型从「直觉型」变成「思考型」。传统 SFT(监督微调)只对最终答案给奖励,导致模型「知其然不知其所以然」。方斌主张用过程奖励模型(PRM)替代结果奖励模型(ORM)——对推理链中的每一步都给出奖励信号。工程上的典型做法:# 伪代码:过程奖励模型(PRM)训练deftrain_prm(model,reasoning_steps,final_answer): reasoning_steps: 模型生成的中间推理步骤 final_answer: 最终答案 step_rewards[]fori,stepinenumerate(reasoning_steps):# 每一步都计算奖励,而非只对最终答案给奖励partial_answerexecute_step(reasoning_steps[:i1])step_rewardcompute_step_correctness(partial_answer,ground_truth)step_rewards.append(step_reward)# 用过程奖励做策略梯度更新loss-policy_gradient(model,reasoning_steps,step_rewards)returnloss工程价值:训练效率比 ORM 高 5-10 倍,模型在数学竞赛、博士级科学问答上的准确率提升 20-30 个百分点。️ 路线 B:世界模型驱动的具身推理(俞扬主张)核心论点:Agentic Scaling 的本质是「在环境交互中学习」,这是强化学习的核心思想,也是 OpenAI 早期(从 DQN 到 AlphaGo)走过的路。俞扬长期研究强化学习与世界模型,主张下一阶段的关键是让模型具备对环境的预测能力——给定当前状态,模型能预测「如果我执行动作 A,会进入什么状态 B」。工程上的典型做法:# 伪代码:世界模型 策略网络的协同训练classWorldModelAgent:def__init__(self):self.world_modelTransformerWorldModel()self.policy_netActorCritic()defimagine(self,current_state,horizon10):在世界模型中想象未来imagined_trajectory[current_state]statecurrent_statefor_inrange(horizon):actionself.policy_net.act(state)next_stateself.world_model.predict(state,action)imagined_trajectory.append(next_state)statenext_statereturnimagined_trajectorydeflearn(self,real_trajectory):用真实轨迹与世界模型想象轨迹做对比学习imaginedself.imagine(real_trajectory[0])losscontrastive_loss(imagined,real_trajectory)returnloss工程价值:在机器人、自动驾驶、游戏 AI 场景中,世界模型能让模型用「想象」替代「真实试错」,训练样本效率提升 100 倍以上。️ 路线 C:多模态统一表征下的自进化(卢志武、张俊林主张)核心论点:真正的自进化不能只靠文字信号,必须把视觉、音频、3D、视频都纳入统一表征,让模型能从多模态数据中持续学习。卢志武长期研究多模态表征统一,主张「同一模型理解图像、视频、音频与文本并自由推理」是自进化的基础设施。张俊林则从工业落地角度补充:多模态推荐系统是验证这一论点的最佳场景。工程上的典型挑战:不同模态的数据规模、token 化方式、计算密度差异巨大(视频比文本重 1000 倍),如何在统一基座里平衡?模态数据规模Token 化计算密度统一表征挑战文本10T token1 token ≈ 4 字符低已成熟图像10B 图Patch(16x16)中与文本对齐视频100M 视频帧 Patch 时间轴高显存与时序建模3D10M 场景点云 / NeRF / Gaussian极高物理一致性音频100K 小时频谱帧中与文本时间对齐工程价值:多模态统一基座是具身智能(需要 3D 视觉)、视频理解(需要时序建模)、推荐系统(需要文本图像)等多个场景的共同基础设施。四、MoE 架构的工程权衡(4 位嘉宾共识)尽管路线不同,4 位嘉宾对MoE 架构的判断高度一致——MoE 已经成为下一代大模型的事实标准,但工程权衡远比理论复杂。维度Dense 模型MoE 模型训练算力全部参数参与仅激活部分专家(典型 8/64)推理成本与参数线性与激活专家数线性显存占用与参数线性与总参数线性(全专家加载)工程复杂度低高(专家路由、负载均衡、通信)能力上限中高(总参数可到万亿级)部署门槛单卡可跑多卡/多机必需张晨(小米 AI 平台部语言模型推理负责人)在 0821 版新加入主推议题里,会专门讨论 MoE 在亿级 DAU 场景下的工程实践——如何在不损失推理质量的前提下,把 MoE 的显存和算力成本压到极致。五、给工程师的 5 个具体行动建议不要押注单一路线:Agentic Scaling 的 3 条路线会同时存在,不同任务选择不同路线——数学/代码用 PRM,机器人/游戏用世界模型,内容理解用多模态统一基座。重新设计训练-推理预算:从 80:20 倒置为 20:80,意味着基础设施团队需要提前采购更多推理 GPU。建立过程奖励模型的工程能力:PRM 是 o 系列的核心,但工程实现远比 ORM 复杂,需要专门的「推理步骤标注流水线」。关注 MoE 的工程开销:MoE 模型的训练-推理成本曲线不是线性的,专家路由策略、负载均衡、跨卡通信都是隐性成本。从演示级到生产级只差一个 Loop:把模型嵌入到「感知-思考-行动-反馈」的闭环里,这正是大会主题里「从 Harness 到 Loop」的含义。六、常见问题 FAQQ1:Agentic Scaling 和传统预训练 Scaling 的核心区别是什么?传统预训练 Scaling 关注训练时的参数/数据/算力规模,模型能力随这三个维度的指数级增长而线性增长;Agentic Scaling 关注推理时的算力展开(token 数量、工具调用、多步规划),模型能力靠推理时的「思考深度」而非「参数规模」提升。Q2:为什么这一届大会把「自进化」放到标题里?因为模型能力的下一阶段增长不再只依赖人类标注数据,而是依赖模型在生产环境与用户交互中自动学习——每一步推理、每一次工具调用、每一个用户反馈都是训练数据。这是从「被动学习」到「主动学习」的范式跃迁。Q3:MoE 架构在工业部署中最大的挑战是什么?显存占用与跨卡通信。MoE 模型的全部专家必须常驻显存(否则每次推理都要从存储加载),但推理时只激活其中一部分——这导致显存成本与 Dense 模型相当,但计算成本只有 1/8。跨卡通信开销在多机部署时尤为突出,需要专家并行(Expert Parallel)与张量并行(TP)的协同。想现场与张俊林、俞扬、方斌、卢志武等 4 位嘉宾面对面深入交流,可前往奇点大会官方渠道免费领取大会 PPT 详细资料。
返回列表