尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何理解大模型的缓存命中,缓存命中为什么费用会低?从模型厂商大模型计算的角度讲解

如何理解大模型的缓存命中,缓存命中为什么费用会低?从模型厂商大模型计算的角度讲解 用户引用内容在业界这被称为**“前缀缓存Prefix Caching”**。正如您所说同样的输入尤其是相同的系统提示词或历史对话模型可以直接复用之前算好的 KV Cache跳过极其耗时的预填充Prefill阶段。因此“命中缓存”和“未命中缓存”在算力成本上有着天壤之别这也直接体现在了 API 的计费价格上。为了让您更直观地理解我们用“编写代码的 AI 助手”作为例子来算一笔“缓存命中”与“未命中”的账场景设定假设您正在使用一款大模型辅助开发项目的背景资料、代码框架和历史对话加起来有10万个 Token。现在您向 AI 发起了第 3 轮对话新提问了1000个 Token。情况一缓存未命中Cache Miss—— 昂贵的“重新计算”假设您在这一轮对话中突然改变了代码架构或者前面提问前言不搭后语导致模型无法复用之前的 KV Cache。计算过程模型必须把那 10万个 Token 的历史背景加上您新提问的 1000个 Token从头到尾全部重新计算一遍生成完整的 KV Cache。成本体现您需要为这10.1万个 Token支付“输入算力费”。由于计算量巨大不仅响应极慢而且非常烧钱。情况二缓存命中Cache Hit—— 便宜的“直接复用”假设您的代码框架和历史背景都没怎么变表达也很清晰。计算过程模型通过基数树Radix Tree发现前面的 10万个 Token 与上一轮对话完全一致。于是它直接读取显存中上一轮留下的 KV Cache跳过这 10万个 Token 的计算。模型只需要为您新提问的1000个 Token计算新的 KV然后追加到缓存中即可。成本体现您只需要为这1000个 Token支付输入费。而那 10万个 Token 因为命中了缓存算力成本通常会直接打 1 折甚至更低例如某模型缓存未命中是 9元/百万Token命中后仅需 0.3元/百万Token。总结大模型推理的“省钱密码”通过上面的例子可以看出大模型推理的成本并不只是看“账面单价”缓存命中率才是决定最终花费的关键。这也是为什么在开发大模型应用Agent时业界有一个共识把静态的背景资料、系统指令System Prompt放在最前面把动态变化的用户问题放在最后面。只要保证前缀不变就能最大程度地触发缓存命中从而大幅降低推理延迟和 API 调用成本。
返回列表