尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Prefix locality

Prefix locality Prefix Locality前缀局部性是指在 LLM 推理服务中不同请求或同一用户的连续请求的 Prompt 开头部分前缀 Token 序列高度重合的现象。它是现代大模型推理引擎如 SGLang、vLLM 等实现Automatic Prefix Caching自动前缀缓存和极低 TTFT首字延迟的理论基础。常见的 Prefix Locality 场景System Prompt系统提示词如“你是一个精通 C 和 compiler 的 AI 助手…”所有并发请求头部都带有这一段固定的系统设定。多轮对话Multi-turn Chat第NNN轮对话的输入天然包含了前N−1N-1N−1轮的全部历史对话内容作为前缀。RAG / 长文档问答多个用户针对同一篇长 PDF 或知识库文档提出不同的问题长文档本身构成了公共前缀。Agent / Few-shot 模板智能体调用的固定思考范式ReAct 模板或少样本示例Few-shot Examples。系统工程如何利用 Prefix Locality由于 LLM 的 Attention 机制具有自回归特性相同的前缀 Token 序列算出来的 KV Cache 是完全一致的。推理引擎利用这一点做缓存优化Radix Tree / 树状管理如 SGLang RadixAttention推理引擎在内存/显存管理器里维持一棵基数树Radix Tree将已计算过的 KV Cache 按 Token 序列节点缓存起来。命中与零开销复用Prefix Cache Hit当新请求进来时调度器先在树上做前缀匹配。若命中长度为LLL的前缀系统直接跳过这LLL个 Token 的 Prefill 计算直接拉取现成的 KV Cache。缓存淘汰策略LRU / LFU当 KV Capacity 紧张时调度器会优先释放最久未被复用的前缀分支 Block保留热点前缀。带来的核心收益降低 TTFT首字延迟长 Prompt 的 Prefill 耗时大幅缩减首字响应速度提升数倍至数十倍。节省算力Save Compute FLOPs避免了对重复前缀做昂贵的 GEMM 矩阵乘法计算。提高系统总吞吐Throughput将省下来的算力与显存空间分配给更多的 Decode 或新请求。
返回列表