尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Equinox: Holistic Fair Scheduling in Serving Large Language Models

Equinox: Holistic Fair Scheduling in Serving Large Language Models Equinox:大语言模型服务中的整体公平调度研究总结与关键内容翻译一、文章主要内容总结本文聚焦大语言模型(LLM)服务中的资源公平调度问题,指出当前主流调度策略(如先来先服务FCFS、每分钟请求数RPM配额、虚拟令牌计数器VTC)存在的缺陷——无法应对Transformer架构“预填充-解码”两阶段的资源需求差异,导致单指标公平性难以实现。为解决此问题,研究提出双计数器框架,从用户和运营商双视角定义公平性:用户公平计数器(UFC):结合加权令牌(输出令牌权重为输入令牌4倍,体现解码阶段资源消耗更高的特性)与用户感知延迟(等待时间+预估执行时间),保障用户服务质量(QoS);资源公平计数器(RFC):通过吞吐量(令牌/秒)和GPU利用率,衡量系统运行效率,确保运营商资源分配公平。同时,为解决“公平性指标需执行后获取”的调度悖论,研究设计确定性预测专家混合模型(MoPE),动态将请求路由至专精于短、中、长令牌序列的预测专家,精准预估用户感知延迟、输出令牌数、吞吐量和GPU利用率,为公平性计算提供前置数据。基于上述设计,研究实现开源系统Equinox,整合自适应批处理、无停滞调度等优化。在真实数据集(ShareGPT、LMSYS)和合成工作负载上的实验表明:与VTC相比,Equinox吞吐量提升最高1.3倍,首令牌延迟降低60%,公平性提升13%,同时保持94%的GPU利用率,在异构平台上实现有界差异下
返回列表