尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

05-训练与部署基础设施

05-训练与部署基础设施 17个AI术语扫盲终章GPU、分布式训练、推理优化——AI从「跑得动」到「跑得快」约 3,400 字 | 预计阅读 12 分钟 | 系列第 5/5 篇基础设施工程师阿哲把团队训练半年的模型部署上线。第一天用户量暴增——然后用户开始投诉「你们的 AI 回复要等 20 秒我喝完咖啡它还没说完。」阿哲查了半天发现 GPU 利用率只有 23%。问题不在算力不够——在 Batch Size 设错了GPU 大部分时间在空等。从「模型跑通了」到「用户可以接受」中间隔着一整套工程体系。这是系列终章——不讲算法不讲 Prompt专讲让 AI 真正跑起来的硬件和系统工程。读这篇文章你会得到GPU 为什么是 AI 的唯一选择——不是因为它「强」是因为一种巧合让它刚好对了分布式训练的本质是「分而治之」——四种并行策略其实在解决四个不同的问题推理优化的终极目标不是让模型更快是让用户感觉不到模型在思考目录GPU、CUDA、TPU为什么这些名词统治了 AI训练 vs 推理同一个模型两种完全不同的工作负载分布式训练当一张 GPU 不够用MoE一个反直觉的架构——「大模型小算力」推理优化从 20 秒到 2 秒的秘密vLLM、KV Cache、Speculative Decoding推理优化的工具箱术语速查表FAQ结语1. GPU、CUDA、TPU为什么这些名词统治了 AI {#1}GPUGraphics Processing Unit图形处理器最初为游戏而生——每秒渲染数百万个三角形需要大量并行计算。这种「并行做简单运算」的能力恰好也是深度学习的核心需求。为什么 GPU 而非 CPUCPU 是为「串行复杂逻辑」优化的——几个强大的核心擅长分支预测和乱序执行。GPU 是为「并行简单运算」优化的——几千个轻量核心同时做矩阵乘法。巧合中的必然神经网络的核心运算是矩阵乘法。一个 4096×4096 的矩阵乘法需要做 687 亿次乘加运算。CPU 用 16 个核心串行做——慢。GPU 用几千个核心同时做——快。同样的计算量GPU 比 CPU 快 10-100 倍。这不是「GPU 比 CPU 强」——是矩阵乘法刚好适合 GPU 的并行架构。CUDACompute Unified Device Architecture统一计算设备架构是 NVIDIA 的 GPU 编程平台。它让你不用写 GPU 汇编用类似 C 的代码就能调用 GPU 计算。CUDA 是 NVIDIA 的护城河——过去 15 年AI 生态的每一座大楼都建立在 CUDA 的地基上。PyTorch、TensorFlow——底层全是 CUDA。GPU 不是一张更快的显卡——它是目前人类大规模制造的最精巧的并行计算机器。NVIDIA 的市值超越全球所有半导体公司不是因为游戏玩家多——是因为全世界的 AI 都在 CUDA 上跑。TPUTensor Processing Unit张量处理器是 Google 自研的 AI 专用芯片。它为 TensorFlow 和矩阵乘法做了深度定制——比 GPU 更快更省电但只能跑在 Google Cloud 上只能用 Google 的软件栈。TPU 做不到的事通用计算。TPU 做得到的事矩阵乘法比 GPU 还快。NPUNeural Processing Unit神经网络处理器是 AI 加速芯片的统称。苹果的 Neural Engine、高通的 Hexagon、华为的昇腾都属于 NPU。和 GPU 的区别NPU 为推理优化省电优先GPU 为训练 推理优化通用优先。2. 训练 vs 推理同一个模型两种完全不同的工作负载 {#2}Training训练和Inference推理是 AI 生命周期的两个阶段——它们对硬件的要求截然不同。维度TrainingInference目标学习参数用学好的参数做预测计算量极大数周-数月较小毫秒-秒方向前向 反向传播仅前向传播精度要求高BF16/FP16可压缩INT8/INT4显存需求极大存梯度 优化器状态较小只存参数 KV Cache延迟要求不敏感极敏感2 秒是底线硬件偏好H100、A100T4、L4、消费级 GPU为什么训练需要这么多显存一个 70B 参数模型用 FP16 训练时显存占用模型参数140 GB梯度140 GB优化器状态Adam280 GB动量 方差各一份合计≈ 560 GB——正好需要 8 张 H10080GB 显存/张Backpropagation反向传播是训练独有的环节。推理只需要前向传播——输入 → 模型 → 输出。训练还需要反向传播——把输出误差从最后一层传回第一层计算每个参数对误差的「贡献度」梯度然后更新参数。Latency延迟是用户感受到的响应时间——从发送请求到收到第一个 Token 的时间 生成完整回复的时间。Throughput吞吐量是系统每秒能处理的请求数。这两个指标天然互斥——优化 Latency 通常会牺牲 Throughput反之亦然。3. 分布式训练当一张 GPU 不够用 {#3}Distributed Training分布式训练是把训练任务拆分到多张 GPU甚至多台机器上并行执行。GPT-4 级别的模型需要上万张 GPU 同时训练数周。四种并行策略解决四个不同的问题Data Parallelism数据并行最直观的策略——每张 GPU 有完整模型的一份拷贝但处理不同的数据批次。计算完梯度后所有 GPU 同步梯度更新参数。问题每张 GPU 都要存完整的模型 优化器状态。70B 模型单卡装不下——DP 直接不可用。Model Parallelism / Tensor Parallelism张量并行把模型的一层「切开」——矩阵乘法的一个大矩阵切分成多个小矩阵分到不同 GPU 上并行计算。Megatron-LMNVIDIA是这一领域的标杆。问题GPU 之间需要频繁通信——通信量极大对 GPU 之间的带宽要求极高需要 NVLink/NVSwitch。Pipeline Parallelism流水线并行把模型按层切开——GPU 0 处理前 10 层GPU 1 处理中间 10 层GPU 2 处理后 10 层。数据像流水线一样流过。问题GPU 有「气泡时间」——GPU 0 处理完第一个批次后要等 GPU 1 处理完才能送第二个批次。GPipe 和 PipeDream 用微批次Micro-batch减少气泡。ZeROZero Redundancy OptimizerDeepSpeed微软提出的优化策略——不是把模型切开而是把优化器状态「分布」到多张 GPU 上。ZeRO-1 分优化器状态ZeRO-2 分梯度ZeRO-3 连参数都分。ZeRO 的意义让原本需要 8 张 GPU 才能训练的模型在同样的硬件上降到 2 张就能跑。它是分布式训练的「民主化」技术。实践中的组合大模型训练通常是 DP TP PP ZeRO 的组合。GPT-4 就用了所有这些策略。4. MoE一个反直觉的架构——「大模型小算力」 {#4}MoEMixture of Experts混合专家是当前最热门的模型架构创新。核心思想模型很大但每次推理只激活一小部分。一个 MoE 模型由多个「专家」Expert即独立的子网络和一个「路由器」Router/Gate组成。输入 Token 进入后路由器决定把它发给哪几个专家处理通常是 Top-2即两个专家。其他专家不参与计算。结果MoE 模型的总参数可能极大如 Mixtral 8×7B 总参数 46.7B但每次推理只激活约 12.9B 参数。激活参数 ≈ 总参数的 25%——用 25% 的算力感受 100% 的规模。为什么出现继续堆 Dense 模型的参数——算力需求线性增长性价比越来越低。MoE 打破了「参数越多 推理越贵」的铁律。MoE 的代价① 显存占用按总参数算——所有专家都要加载路由器决策也有开销② 负载均衡——如果某些专家总是被选中而另一些闲置「专家坍塌」训练就废了③ 微调更复杂——专家之间的路由行为在微调时容易漂移。模型总参数激活参数激活比例Mixtral 8×7B46.7B12.9B28%GPT-4传闻1.76T~280B~16%DeepSeek-V2236B21B9%5. 推理优化从 20 秒到 2 秒的秘密 {#5}推理优化Inference Optimization的目标在不显著牺牲模型质量的前提下让推理更快、更省资源。为什么推理优化这么重要因为用户不耐烦。一项 Google 研究显示移动端页面加载超过 3 秒53% 的用户会放弃。AI 回复的容忍度稍高——但超过 5 秒用户就开始焦虑超过 15 秒大部分用户会切去做别的事。Streaming流式输出是用户体验的第一道防线——不等到完整回复生成完毕生成一个 Token 就显示一个 Token。用户感觉「有东西在出来」——心理等待时间大幅缩短。ChatGPT 和 Claude 都用了流式输出。推理优化的本质不是让模型更快——是让用户感觉不到模型在思考。2 秒流式输出 心理等待管理有时比 0.5 秒的批量返回更让人满意。6. vLLM、KV Cache、Speculative Decoding推理优化的工具箱 {#6}KV Cache键值缓存第一篇讲过 Attention每个 Token 会和所有之前的 Token 做注意力计算。生成第 1000 个 Token 时要对前 999 个 Token 重新计算 Attention。浪费。KV Cache 的做法很简单把之前计算过的 Key 和 Value 向量缓存起来——生成下一个 Token 时只计算新 Token 的 Q/K/V旧的直接复用。效果推理速度提升数倍。代价显存占用增加。KV Cache 是目前所有 LLM 推理框架的标配。vLLMvLLM是 UC Berkeley 开源的高性能推理引擎。它的核心创新是PagedAttention——像操作系统管理内存一样管理 KV Cache用「分页」机制避免显存碎片。结果显存利用率大幅提升同样硬件可以处理更多并发请求。2025 年vLLM 和 TensorRT-LLMNVIDIA是生产环境的两个主流推理引擎。一般规律——NVIDIA GPU 用户首选 TensorRT-LLM追求开源灵活性的团队选 vLLM。Speculative Decoding推测解码核心思路很有意思——用小模型「草稿」让大模型「审批」。大模型逐个生成 Token 很慢。Speculative Decoding 让一个极小的「草稿模型」快速生成一批候选 Token比如 5 个然后大模型一次性验证这 5 个——通过就全部采用不通过就退回到第一个错误的 Token。效果在保证输出质量完全不变的前提下推理速度提升 2-3 倍。大模型的输出没有变化——只是验证比生成快得多。Batch Processing批处理把多个推理请求合并成一批GPU 同时处理。批处理提升 Throughput——并发用户越多批处理优势越大。代价单次请求的 Latency延迟可能增加——因为要等同一批的其他请求算完。Continuous Batching连续批处理是 vLLM 的重要创新——不等一批请求全部完成完成一个就换下一个进队列。相比传统「等整批完成再换新批」的做法吞吐量提升了数倍。7. 术语速查表 {#7}缩写/术语英文全称中文本质一句话GPUGraphics Processing Unit图形处理器大规模并行计算芯片深度学习的硬件支柱CUDACompute Unified Device Architecture统一计算设备架构NVIDIA 的 GPU 编程平台AI 生态的软件地基TPUTensor Processing Unit张量处理器Google 的 AI 专用芯片矩阵乘法加速NPUNeural Processing Unit神经网络处理器AI 加速芯片统称手机端推理为主—Training训练用数据学习模型参数需要前向反向传播—Inference推理用学好的参数做预测只需前向传播—Distributed Training分布式训练多 GPU 甚至多台机器协同完成训练—Data Parallelism数据并行每张 GPU 一个完整模型切分数据—Tensor Parallelism张量并行将矩阵运算切分到多张 GPU 并行计算—Pipeline Parallelism流水线并行按层切分模型数据流水线式传递—ZeRO零冗余优化器DeepSpeed 的优化策略分片存储优化器状态MoEMixture of Experts混合专家大模型但每次只激活部分参数—Inference Optimization推理优化在不牺牲质量的前提下加速推理—Streaming流式输出逐 Token 返回减少用户心理等待时间—KV Cache键值缓存缓存 Attention 的 Key/Value 避免重复计算—vLLM项目名高性能开源 LLM 推理引擎PagedAttention 发明者—Speculative Decoding推测解码小模型草稿 大模型审批2-3× 推理加速—Latency延迟用户感知的响应时间—Throughput吞吐量系统每秒可处理的请求数—Batch Processing批处理合并多个推理请求并行处理8. FAQ {#8}GPU 为什么会成为 AI 的唯一选择不是「唯一」——是「最优」。CPU 也能跑 AIllama.cpp 让 MacBook 跑 7B 模型成为可能但在训练和大规模推理场景下GPU 的并行架构 CUDA 生态 几十年积累的矩阵乘法优化让它在性价比上遥遥领先。过去十年没有任何硬件能真正挑战 GPU 在 AI 训练中的统治地位。我需要多少显存来跑一个 7B 模型量化到 4-bit约 4-6 GB 显存。一张 RTX 306012GB就很从容。量化到 8-bit约 8-10 GB。FP16不量化约 14-16 GB——RTX 3090/409024GB可以。经验法则参数数量B× 2 FP16 显存占用GB× 0.5-0.7 4-bit 量化后的显存占用。分布式训练我应该用哪种并行策略从小到大的推荐路径单卡能跑 → 不折腾。单卡装不下模型 → ZeRO-3DeepSpeed。ZeRO 不够 → ZeRO-3 Tensor Parallelism。还不行千卡级别→ 四种并行全都上。99% 的团队不需要超过 ZeRO-3。MoE 模型未来会取代 Dense 模型吗不会完全取代但会成为主流架构之一。MoE 在「参数规模 / 推理成本」这个指标上碾压 Dense 模型。但 Dense 模型在特定场景仍有优势——微调更简单、推理延迟更可预测。趋势旗舰模型走向 MoEGPT-4、Gemini、DeepSeek小型模型保持 Dense。推理延迟多慢算「不可接受」TTFTTime to First Token首 Token 延迟 500ms总生成速度 30 Token/秒是目前的生产基准。超过 2 秒 TTFT用户体验显著下降。超过 10 Token/秒的生成速度用户开始察觉到「打字感」。你的目标不是理论最优——是用户不觉得它在「加载」。vLLM 和 TensorRT-LLM 怎么选NVIDIA GPU 追求极致性能 → TensorRT-LLM。多硬件兼容 快速迭代 开源社区 → vLLM。两个引擎在 2025 年差距已缩小到 10-20% 的性能区间。更重要的决策不是你选哪个引擎——是你投入多少精力去调参数。9. 结语 {#9}五篇文章80 个术语从 LLM 的概率本质到 Prompt 的采样空间约束到 Agent 的多步决策到 GPU 的并行矩阵——我们走完了从「AI 是什么」到「AI 怎么跑起来」的完整旅程。阿哲调整了 Batch Size优化了 KV Cache换上了 vLLM。推理延迟从 20 秒降到了 1.8 秒——用户投诉消失了。没人注意到推理速度变快——这正是成功当基础设施做得对它是隐形的。AI 术语永远在增长。明年会有新的架构、新的框架、新的名词。但这五篇文章建立了一个坐标系——以后每遇到一个新术语你都能把它放进这个系统里它是关于「模型怎么思考」的第一篇它是关于「人怎么和模型对话」的第二篇它是关于「怎么让模型听话」的第三篇它是关于「模型能做什么」的第四篇它是关于「怎么让模型跑起来」的第五篇坐标系比单个名词更重要。因为名词会变但问题不变。 系列回顾篇序标题核心术语数1大模型核心概念182提示词与检索增强143微调、对齐与优化154Agent 与多模态165训练与部署基础设施本篇17合计80如果你一口气读完了五篇——请收下我的敬意。知识只有被使用才有价值。去找一个问题用一个你新理解的概念去解决它。哪个术语的解释让你对 AI 的某个困惑豁然开朗评论区告诉我这是写这个系列最大的回报。
返回列表