尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

北大计算机金鑫团队提出全新MoE分离式推理系统,有效吞吐量提升2倍

北大计算机金鑫团队提出全新MoE分离式推理系统,有效吞吐量提升2倍 MoE大模型越做越大推理系统面对的麻烦却不只来自算力。传统Prefill–DecodePD分离Prefill-Decode DisaggregationPDD通常为两个阶段分别部署完整模型。随着专家权重增大一套实例可能跨越数十张GPU。资源比例稍有不匹配就会出现一边过载、另一边闲置。曾获得USENIX NSDI 2018与FAST 2019最佳论文奖的北大计算机学院长聘副教授金鑫与团队共同提出MoE推理系统ExpertPlex。论文标题ExpertPlex: A High-Goodput Disaggregated Serving System for MoE LLMs withAdaptive Persistent Kernels论文链接https://arxiv.org/abs/2607.18002它没有为Prefill和Decode复制两套完整模型也没有把每张GPU固定切成两部分而是共享占模型参数95%以上的MoE专家只拆分轻量attention模块。在MiniMax-M2.7和GLM-5.1-FP8上ExpertPlex相较实例级PDD将有效吞吐量goodput最高提升2.01倍相较基于Green Context的共置方案最高提升1.66倍。01完整模型拆两份资源越来越难配Prefill负责处理输入并建立KV Cache更看重吞吐。Decode每轮生成一个Token更在意延迟。PDD把两个阶段放到不同实例上换来了隔离也带来了权重复制。论文提到一种DeepSeek-V3部署单元使用32张GPU处理Prefill320张GPU处理Decode。小集群很难凑出这种比例大集群也只能按照较大的部署单元调整资源。Prefill–Decode共置同样有问题。Green Context可以预留SM但kernel运行期间的资源划分基本固定。MoE每层激活的专家数量却在变化长Prefill kernel可能挡住紧急Decode预留给Decode的SM也可能空转。队头阻塞Head-of-line blocking、资源空泡Resource bubbles和网络干扰Network interference等问题会同时出现。02把拆分边界移到attention与MoE之间ExpertPlex把GPU分为Prefill Server、Decode Server和MoE Server。前两类服务器分别运行各自阶段的attention模块。MoE Server保存专家权重同时执行两个阶段的专家计算。由于MoE权重占模型参数的95%以上这种布局避免了最重部分的跨阶段复制。attention权重不足模型参数的5%。将它按阶段拆开代价远小于复制整个MoE模型还能让Prefill和Decode各自使用完整GPU减少GPU切分带来的并行和通信开销。ExpertPlex不是简单选择共置或分离而是重新选择共享边界。03在tile边界给Decode快速让路共享MoE专家后关键变成如何让Prefill和Decode共用GPU又不让长任务拖住短任务。ExpertPlex为每张MoE GPU运行Adaptive Persistent KernelAPK长期驻留GPU并按tile动态调度任务的内核。APK不等整个kernel结束而是在tile边界决定下一块计算交给哪个阶段。tile是GPU操作中可以独立完成的最小计算块。论文测得MoE侧操作的tile边界间隔约为2.2至25.3微秒而且不会随着输入序列变长而扩大。Decode到来后APK只需等待当前tile结束再切换CTA cluster无需保存和恢复整段kernel状态。通信也从attention端发起。Dispatch直接写入目标bufferCombine由attention端主动读取MoE端无需运行配对通信kernel从而减少轮询、双边等待和跨阶段死锁。04真正拉开差距的是端到端服务能力在MiniMax-M2.7与ShareGPT上ExpertPlex在联合SLO下达到每节点每秒11.3个请求。相较SGLang-ChunkedPrefill提升5.65倍相较SGLang-Colocated提升2.72倍相较SGLang-PDD提升2.01倍。长请求下差距更加明显。在MiniMax-M2.7与LooGLE上ExpertPlex相较SGLang-Colocated提升4.12倍。在GLM-5.1-FP8与LooGLE上它相较ChunkedPrefill提升5.0倍相较共置方案提升2.5倍相较SGLang-PDMux提升1.66倍。在GPU共享实验中CUDA Stream让Decode延迟扩大13.79倍。MPS和Green Context分别让Prefill变慢3.33倍和4.07倍。ExpertPlex只为Decode增加8%开销同时Prefill仅变慢1.12倍。它优化的不是某一个kernel而是动态MoE负载下整套服务系统的资源协同。ExpertPlex的路线很清楚。最重的MoE专家不再重复保存轻量attention按阶段独立部署GPU在tile边界快速让路通信也由attention端主动发起。当MoE模型继续扩大关键不只是增加并行度而是把权重、计算和网络放到更合适的共享边界上。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表