尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Agent开发工程师成长指南》- 第2章 第7节:Scaling Law为什么重要?——为什么模型越大,能力越强?

Agent开发工程师成长指南》- 第2章 第7节:Scaling Law为什么重要?——为什么模型越大,能力越强? 第一卷大模型 基础篇第2章 大模型基础原理第7节Scaling Law为什么重要——为什么模型越大能力越强《Agent开发工程师成长指南》系列教程引言近几年大模型的发展速度远远超出了很多人的想象。2018年BERT 3.4亿参数2020年GPT-3 1750亿参数2023年GPT-42024年Claude 3Gemini 1.5DeepSeek-V3越来越大的模型。越来越长的上下文。越来越强的推理能力。很多人会问为什么模型越来越大就越来越聪明是不是参数越多 能力越强答案并没有这么简单。真正推动整个大模型时代的理论基础之一就是Scaling Law尺度定律它告诉整个AI行业模型能力并没有遇到明显瓶颈只要数据、模型和算力继续增长模型能力就会持续提升。一、什么是 Scaling LawScaling Law。中文通常翻译为尺度定律一句话理解当模型规模、训练数据和计算量按照一定规律持续增加时大模型能力也会按照可预测的规律不断提升。简单来说模型更大 数据更多 训练更久 ↓ 模型更强这就是Scaling Law 最核心的思想。二、为什么 Scaling Law 会震惊整个AI行业在 GPT 出现之前。很多研究人员认为模型做到一定规模以后。能力会进入平台期。例如100M ↓ 300M ↓ 1B ↓ 效果越来越小很多人认为继续扩大模型。意义已经不大。但是。OpenAI 在 GPT 系列实验中发现模型越大 ↓ Loss 持续下降 ↓ 能力持续提升而且这种提升。不是随机的。而是遵循数学规律。这就是Scaling Law。三、Scaling Law 包括哪三个核心维度目前。Scaling Law 主要关注三个因素。① Model Size模型参数例如1B ↓ 7B ↓ 13B ↓ 70B ↓ 671B参数越多。模型能够学习更加复杂的知识。例如语言 代码 数学 推理 规划都会不断提升。② Dataset训练数据模型再大。如果没有数据。也学不会。例如100GB ↓ 1TB ↓ 10TB ↓ 100TB数据越丰富。模型理解世界越全面。例如新闻 论文 代码 百科 网页 数学都会进入模型知识体系。③ Compute计算量训练一个模型。不仅需要模型。还需要GPU TPU 训练时间 训练轮数例如更多GPU ↓ 更多训练Token ↓ 更充分训练模型能力也会继续提升。四、为什么模型越大能力越强很多新人认为参数就是存储更多知识其实不是。真正原因是参数越多。模型能够表示更加复杂的函数。例如小模型 ↓ 只能学习简单规律而大模型 ↓ 能够学习复杂世界模型例如不仅会翻译还能写代码 做规划 数学推理 Agent决策五、Scaling Law 最经典的一张图几乎所有论文。都会出现类似曲线。横轴Compute纵轴Loss得到Compute ↑ ↓ Loss ↓形成一条Power Law幂律曲线。也就是说随着模型 数据 算力不断增长。Loss持续下降。没有明显平台期。这也是整个AI行业持续投入万卡集群的重要原因。六、Scaling Law 为什么推动了 GPT 时代如果没有 Scaling Law。很多公司可能会认为继续扩大模型 ↓ 收益有限但是Scaling Law 告诉大家继续扩大模型 ↓ 仍然有效于是全球开始训练更大的模型例如GPT Claude Gemini Llama Qwen DeepSeek几乎都遵循Scaling Law 思路。七、Scaling Law 为什么会出现涌现能力这是一个非常神奇的现象。例如7B模型不会数学推理到了70B模型突然能够 推理 规划 代码生成 Agent任务这种突然出现的新能力。被称为Emergent Ability涌现能力也就是说模型不是一点一点增加能力。而是达到某个规模以后。突然学会了。因此Scaling Law不仅意味着能力变强。还意味着可能产生新的能力。八、Scaling Law 与 Agent 有什么关系很多人认为Scaling Law。只是训练模型的人关心。其实Agent开发工程师也必须理解。因为Agent能力最终依赖LLM能力例如一个Agent需要规划 ↓ 调用Tool ↓ 多轮决策 ↓ 反思 ↓ 继续执行如果模型太小。可能不会规划不会Tool Calling不会复杂推理因此Agent首先需要足够强的大模型。九、Scaling Law 的局限性虽然Scaling Law 非常成功。但并不是无限成立。近年来。行业也发现继续扩大参数收益开始下降。于是出现了新的研究方向。例如MoE混合专家 推理模型 Test-Time Compute 高质量数据 强化学习 合成数据大家开始不仅关注模型大小。还关注训练方法以及推理效率十、为什么现在大家开始重视数据质量过去。很多人认为数据越多越好后来发现垃圾数据 ↓ 模型能力下降于是现在越来越重视高质量数据 ↓ 数据清洗 ↓ 数据去重 ↓ 合成数据 ↓ RLHF ↓ RFT说明Scaling Law正在进入第二阶段。十一、企业为什么也要关注 Scaling Law企业通常不会训练GPT。但是需要选择模型。例如7B 14B 32B 70B如何选择如果客服机器人。可能7B RAG ↓ 已经足够。如果企业Agent需要复杂规划可能需要70B 或者 推理模型因此理解 Scaling Law。可以帮助工程师选择最合适的模型。而不是一味追求最大模型。十二、Scaling Law 给 Agent 开发工程师最大的启发不要只关注Prompt真正影响Agent能力的因素包括模型能力 Prompt RAG Tool Workflow其中模型能力来自Scaling。Prompt无法弥补模型能力不足。因此企业Agent。首先要选对模型。然后再优化Prompt。十三、Scaling Law 知识链总结整个知识体系可以串联为更多参数 ↓ 更强表示能力 ↓ 更低Loss ↓ 更强理解能力 ↓ Emergent Ability ↓ 推理能力 ↓ Agent能力一句话总结Scaling Law 解释了为什么大模型能够不断突破能力边界也是整个大模型时代快速发展的理论基石。面试题问题1什么是 Scaling Law参考答案Scaling Law 指模型参数、训练数据和计算量按照一定规律增加时大模型性能会以可预测的方式持续提升是现代大模型发展的重要理论基础。问题2Scaling Law 包括哪三个核心因素参考答案包括模型规模Model Size、训练数据Dataset和计算量Compute三者共同决定模型最终能力。问题3为什么 Scaling Law 推动了 GPT 时代参考答案因为实验发现扩大模型规模不会很快进入性能平台期而是仍能持续降低 Loss、提升能力这使整个行业相信训练更大的模型是有效的。问题4Scaling Law 与 Agent 有什么关系参考答案Agent 的规划、推理、工具调用等能力依赖底层大模型。理解 Scaling Law 有助于工程师根据业务复杂度选择合适的模型而不是盲目追求参数规模。问题5Scaling Law 是否意味着模型越大越好参考答案不是。随着模型继续增大收益会逐渐降低行业开始更加关注高质量数据、MoE、推理模型、强化学习等技术因此需要综合考虑成本、性能和业务需求。本章小结本节我们学习了✅ 什么是 Scaling Law✅ Scaling Law 的三个核心因素✅ 为什么模型越大能力越强✅ Scaling Law 与涌现能力的关系✅ Scaling Law 如何推动 GPT 时代✅ Scaling Law 对 Agent 开发工程师的意义
返回列表