尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

一文讲清大语言模型推理系统:技术演进、核心组件与未来挑战综述,看到就是赚到!!

一文讲清大语言模型推理系统:技术演进、核心组件与未来挑战综述,看到就是赚到!! 前言过去几年见证了专业的大语言模型LLM推理系统例如 vLLM、SGLang、Mooncake 和 DeepFlow以及通过 ChatGPT 等服务快速采用 LLM。 推动这些系统设计工作的是 LLM 请求处理独特的自回归特性这促使人们开发新的技术以在高容量和高速度的工作负载下实现高性能同时保持较高的推理质量。 虽然许多这些技术在文献中都有讨论但它们尚未在完整推理系统的框架下进行分析系统本身也未经过分析和比较。在本综述中我们回顾了这些技术首先从请求处理的算子和算法开始然后转向模型优化和执行技术包括内核设计、批处理和调度最后以内存管理技术结束包括分页内存、驱逐和卸载技术、量化和缓存持久性。 通过这些讨论我们表明这些技术从根本上依赖于负载预测、自适应机制和成本降低以便克服自回归生成带来的挑战并实现系统的目标。 然后我们讨论如何将这些技术组合起来形成单副本和多副本推理系统包括提供对资源分配更多控制权的分离式推理系统以及可以部署在共享硬件基础设施上的无服务器系统。 最后我们讨论了剩余的问题挑战。1 引言自从序列生成从循环神经网络转向 Transformer以来大型语言模型LLM现在已经达到了一定的质量水平可以使用它们来完成各种任务包括交互式通用问答、文档摘要和分类、语言翻译、代码生成 数据整理等 。 这一突破导致了 LLM 在工业界和普通消费者中的指数级增长通过 ChatGPT、Gemini、Claude、Grok、Kimi 和 DeepSeek 等服务给设计能够支持高性能模型服务的系统带来了压力。图 1 LLM 推理堆栈为了满足这一需求已经开发出专门的 LLM 推理系统来管理模型执行的各个方面除了基本的 LLM 推理工作流程之外还包括系统级的方面例如负载平衡、作业批处理、作业调度和内存管理这与其他高容量和高速数据处理系统类似。 但是基于 Transformer 的 LLM 推理的独特的自回归特性意味着必须为这些方面中的每一个开发新的技术。传统的数据处理系统通过对输入执行一次操作序列来处理请求但 LLM 需要执行多次次数与请求输出的长度成正比。所有请求都采用文本字符串的形式输出长度非确定性地取决于字符串的文本内容。 由于字符串内容可以是用户想要的任何内容因此不存在典型的输出长度。 因此请求处理成本尤其是内存成本是未知的并且可能在极大的范围内变化即使是内容相似的请求之间也是如此。输出的根本非确定性导致了 LLM 推理系统的三个关键挑战。(1) 尽管最近取得了突破但就输出满足请求表达的任务的程度而言输出的质量仍然无法保证因为输出是由非确定性采样生成的而不是从数据中进行分析构建的。 (2) 执行轮次的不确定数量意味着处理请求的最终内存使用量是未知的这使得为一次处理多个请求的系统分配内存具有挑战性。 (3) 同样由于处理请求所需的时间也是不确定的因此设计可以避免诸如掉队者和队首阻塞等问题的批处理和调度技术也具有挑战性。为了应对这些挑战LLM 推理系统采用了许多技术涵盖了面向用户的前端以及执行运行时如图 1 所示。 为了提高 LLM 的质量推理系统支持一系列序列生成技术例如束搜索、思维树、思想图和自洽性这些技术可以提高生成高质量输出的可能性图 1©以及许多提示技术。 多种技术导致了旨在简化用户交互的前端设计图1(a)其功能包括自动提示优化和约束输出生成图1(b)旨在减轻制作提示和协调复杂工作流程的负担。 为了适应动态内存需求推理系统依赖于基于页面的块内存分配并结合缓存持久化和量化技术以减少总体内存使用量图1(g)。 为了适应动态请求生命周期推理系统使用动态作业调度、动态批处理和灵活的负载均衡图1(d, e)这些都基于负载预测机制以及专门的算子和内核实现以降低总体推理成本图1(f, h)。在本调查中我们将在一个综合推理系统的框架内讨论这些技术。 在第2节中我们将讨论对于执行高质量的大语言模型推理至关重要的算子和序列生成算法。 在第3节中除了内核设计我们还将讨论批处理和调度的技术内核设计旨在开发高效的算子实现以利用专门的硬件。 在第4节中我们将讨论内存管理技术包括基于页面的内存、用于支持请求抢占和长上下文的驱逐和卸载技术、量化和缓存持久化技术包括缓存重建技术。 在这些讨论之后在第5节中我们将讨论如何将这些技术结合起来形成当前的大语言模型推理系统格局包括旨在托管单个大语言模型副本的环境的单副本系统以及旨在通过多个大语言模型副本处理请求的多副本系统。 这些系统尤其允许分离的架构从而可以更好地控制硬件资源的分配方式2请求处理基于Transformer的语言模型在离散的有限token集合上运行产生一个输出token以响应一系列输入tokenx1⁢…⁢xp所有这些token都是该集合的成员。 这是通过将 Token 集合映射到高维向量空间来实现的从而允许将简单的线性变换应用于 Token 嵌入以生成上下文相关的嵌入xp最终从中选择输出 Token。第 5 节中将要介绍的所有大语言模型推理系统都使用基于 Transformer 的模型这些模型遵循相同的基本推理工作流程主要依赖于嵌入上的注意力机制、前馈和 Token 采样算子来生成输出 Token第 2.1 节。 然而注意力机制和前馈算子的高昂根本成本以及生成能够产生语义连贯且在其他方面可接受的文本的 Token 的需求 2 激发了人们在算子设计方面的大量努力第 2.2 节。 此外由于 Token 只能一次生成一个的固有局限性生成长文本序列涉及多轮模型执行并且由于每个输出 Token 可能对每轮给定的输入高度敏感因此这些相同的担忧也导致了各种序列生成技术第 2.3 节。 面对这种多样化的请求处理技术系统设计人员必须仔细权衡这些技术的各种优点和缺点以及系统其余部分的设计方式以及下游的后果将在第 2.4 节中讨论。2.1推理工作流程一个请求由一个初始输入x1⁢…⁢xp称为提示或前缀组成。 响应是基于提示的完整序列x1⁢…⁢xp⁢…⁢xn。 计算 Token xi1对于 i≥p需要对所有先前的 Token 即 xi1LLM⁢(x1⁢…⁢xi)执行一次模型因此输出序列通过反馈先前的 Token 一次形成一个 Token这个过程称为自回归生成。图 2 一个 Transformer 层中的 Prefilla和解码b生成一个输出token时每个输入token首先通过嵌入模型映射为高维向量表示。这些向量随后流经一系列功能相同但参数各异的Transformer层被赋予上下文信息。最终输入序列末位token的上下文向量被送入token采样器从而产生输出token。图2展示了这一流程。在每个 transformer 层内部有一个注意力算子与一个前馈网络FFN相结合中间夹杂着一个归一化算子 。 注意力算子和 FFN 主要通过将嵌入乘以各种权重矩阵来工作这些权重矩阵的值通过训练来确定。 因此这些算子的基本计算和存储内存成本取决于这些矩阵的大小。 具体而言对于注意力算子将算子应用于第i个嵌入需要第j个嵌入的线性投影i.e.key和value向量ji。 由于序列生成是自回归的因此这些投影的数量i.e.KV cache的大小在请求的生命周期内会增长。 因此处理请求的总计算和内存成本取决于其输出的长度。性能和准确性。高成本表现为高端到端延迟包括提交请求和生成完整输出序列之间的时间。 但由于大语言模型的自回归特性输出可以在生成 Token 的同时流式传输给用户。 因此对于诸如问答之类的交互式应用只要 token 之间的时间间隔TBT和第一个 token 的响应时间TTFT较短较长的延迟不一定会导致较差的用户体验。 其他应用场景例如文档摘要可能对token吞吐量或请求并发量更为敏感。 对于对延迟和吞吐量都敏感的请求有效吞吐量可能是一个更有用的性能指标它被定义为在特定延迟目标即服务级别目标或 SLO内完成的请求数量 。用户也需要高质量的输出。 但是由于用户提示可以表达各种各样的任务从知识检索到语义操作 输出的质量高度依赖于任务从而排除了通用的质量指标。 对于衡量大语言模型的一般质量通常使用困惑度。 诸如BLEU 和 ROUGE ROUGE等指标已被用于特定任务例如机器翻译和文档摘要 。2.2算子图 3: 单头和多头注意力。 在 MHA 中每个注意力头产生的低维 delta 向量被连接起来并乘以一个重投影矩阵。对高性能和高精度推理的需求激发了对注意力、FFN 和 Token 采样算子的新设计。 对于注意力算子, 引入了一种多头注意力 (MHA) 机制来提高推理质量。 分组查询注意力 (GQA) 和多查询注意力 (MQA)进一步发展了这个想法通过减少变换矩阵的大小和数量来降低基本的计算和内存成本。 同样许多工作集中在稀疏注意力上还有一些共享注意力的技术例如chunkattention 其中某些注意力输出在多个请求之间共享从而减少了内存负担。 对于 FFN专家混合 (MoE) 技术通过将 FFN 分割成多个小的独立网络 liu2025survey 来工作从而减少了计算负担。对于oken 采样诸如 top-k 采样和 nucleus 采样等随机采样技术通过探索 Token 空间的狭窄区域之外的区域来提高推理质量而推测解码技术通过利用小型草稿模型然后进行并行验证 decoding 来提高 Token 吞吐量。2.3 序列生成生成完整输出序列时可采用递归方式将已生成的部分序列重新输入模型以流式方式逐个生成后续token直至满足终止条件如生成终止token。但提示词****prompt的微小差异——例如链式思维CoT提示wei2022chain少样本示例xu2024does其他提示工程技巧sahoo2025systematic可能显著改变输出结果进而影响成本和准确性。另一方面结构化生成方法通过维护一组候选输出序列按自回归方式推进每个候选序列最终择优返回。例如束搜索beam search, graves2012sequence思维树Tree-of-Thoughts, yao2023tree思维图Graph-of-Thoughts, besta2024graph自洽性Self-Consistency, wang2023self这些方法虽增加了请求处理成本但通常能提升多数任务的输出质量。流式生成Streaming链式思维提示在提示词中插入show your work等关键短语诱导大模型生成更长响应提升任务完成度wei2022chain。少样本学习在提示词末尾附加已完成实例xu2024does目标类似。内化链式思维通过奖励引导的强化学习训练模型使其无需显式提示词即可生成类CoT输出fu2024efficiently。更多提示工程技术详见sahoo2025systematic综述图 6: 当 k3时的beam search示例.结构化生成Structured通过维护候选池并动态筛选生成结果图6为束搜索k3示例束搜索同时维护k个候选序列每步采样多个token保留全局top-k序列推进最终返回累计logit最高的序列graves2012sequence。思维树将候选序列组织为搜索树通过不同提示策略扩展子节点yao2023tree。思维图将节点视为逻辑图支持聚合多父节点等操作besta2024graph。自洽性删除与其他候选差异过大的输出促使剩余候选收敛至高质量结果wang2023self。2.4 讨论自回归请求的不可预测性是LLM推理系统的核心特性区别于传统大数据处理系统输出长度决定处理成本但除少数受控场景见5.1节外终止长度无法预先确定。注意力机制导致的提示词交互复杂性进一步阻碍终止轮次的分析预测。这种不确定性尤其对内存影响催生了分页注意力4.1节、作业再平衡3.3节等动态适应技术以及预测内存成本3.4节或直接降低成本的方案4.3节。注意力机制、FFN、token采样与序列生成技术虽可独立适配任意推理系统但设计时需考虑其特性投机解码需单独训练草稿模型drafter可能不适合依赖输出多样性的创意任务。稀疏注意力、MoE等效率优化方案可能牺牲准确性束搜索、思维树等准确性优化方案则增加成本。未来展望随着LLM向多领域扩展luo2024projecting及专用硬件发展kwon2025lol针对特定场景的算子设计与生成策略如强化学习、新型提示策略等可能重塑推理系统设计deepseekai, zhang2024reactable。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表