
摘要AI 应用跑通容易跑“赚”很难token 费、GPU 费、调优的人力费账越算越痛。本文用一家企业 AI 应用的完整降本案例拆解成本工程的四板斧——Prompt 瘦身、语义缓存、模型分层、蒸馏并给出可直接套用的成本核算框架帮团队把单位请求成本降下来、把 ROI 算清楚、把 AI 投入从“成本中心”变成“利润中心”。关键词LLM 成本、AI 应用成本、token 优化、语义缓存、模型蒸馏、成本优化、模型分层、ROI 核算、AI 降本、奇点智能大会一、先算清楚账AI 应用的钱都花在哪很多团队的 AI 成本是“一笔糊涂账”知道每个月账单不小但说不清花在哪。成本工程的第一步永远是“核算框架”——把成本拆到可归因的最小单元。建议按三个维度记账模型维度哪个模型、哪个版本花了多少、场景维度哪个业务功能花了多少、环节维度输入 token、输出 token、工具调用、重试各占多少。一家做企业知识问答的客户第一次做成本归因时发现两个反直觉的事实第一输出 token 的成本是输入的 3 倍因为输出单价高、且 Agent 链路里输出占比大第二40% 的成本花在“失败重试”上——模型输出格式非法、工具调用失败反复重试白白烧钱。这两个发现直接决定了降本的方向先治重试再优化 token。没有核算就没有方向——成本工程从“看清账本”开始。二、第一板斧Prompt 瘦身与上下文精简成本与 token 数量直接挂钩Prompt 瘦身是性价比最高的第一刀。常见浪费系统提示里堆了大量从不生效的规则、历史对话全量塞进上下文、工具描述冗长重复。瘦身手法删冗余规则用评测确认删了不影响效果、历史摘要化把长对话压缩成摘要再进上下文、工具描述精简description 只留关键触发信息。一个实测案例某客服 Agent 把系统提示从 3000 token 精简到 1200 token工具描述从每轮 800 token 减到 300 token单次请求 token 数下降 45%而效果评测问题解决率几乎不变——因为精简掉的都是“看似严谨、实则不生效”的冗余内容。Prompt 瘦身的经验法则是“删了再测、测了再删”用评测集验证每次精简掉了效果就回滚没掉就继续。三、第二板斧语义缓存让重复问题不再重复花钱企业 AI 应用里存在大量“重复请求”不同的用户问着相似的问题同一个用户反复问同一个问题。对这些请求与其每次都调用模型不如缓存答案。语义缓存的原理把用户问题向量化与缓存库里的历史问题算相似度命中相似度超过阈值就直接返回缓存答案不调模型。Plain Text# 语义缓存示意命中则跳过模型调用 def answer_with_cache(question, threshold0.92): q_vec embed(question) hit cache.search(q_vec, threshold) # 向量相似度检索 if hit: return hit.answer, {cache: True} # 缓存命中零模型成本 answer call_llm(question) # 未命中正常调用 cache.store(q_vec, answer, ttl24h) # 存缓存带有效期 return answer, {cache: False}某企业客服场景的实测语义缓存命中率 28%意味着 28% 的请求零模型成本总成本直接下降近三成。缓存的工程要点阈值要按场景调太松会答错、太紧命中率低缓存答案要带有效期政策变化后旧答案不能继续发敏感场景慎用缓存涉及个性化或实时数据的问题不缓存。缓存是把“重复计算”变成“查表”是成本工程里最优雅的一刀。四、第三板斧模型分层让“贵模型”只干“贵活”不是所有请求都值得用最强模型。模型分层的思路按任务难度分配不同档位的模型——简单任务分类、抽取、格式转换用小模型复杂任务推理、规划、多步工具调用用大模型。层级的依据不是拍脑袋而是评测先在小模型上跑评测集能达标的任务就固定走小模型。一个文档处理产品的实践原来所有请求都走旗舰模型成本高企。他们把任务分成三档格式整理与分类走小模型成本低 10 倍评测达标率 96%、摘要与改写走中型模型、只有复杂推理与代码生成走旗舰模型。改完后整体成本下降 62%而端到端效果用户满意度只降了 2 个点——因为 60% 以上的请求本来就不需要旗舰能力。模型分层的核心洞察用户要的是“结果正确”不是“模型强大”。五、第四板斧蒸馏把“专家”压缩成“快枪手”当某个场景的请求量大、且效果要求高时模型分层的下一刀是“蒸馏”用大模型的输出做训练数据蒸馏出一个小模型专门服务这个场景。蒸馏的适用条件场景稳定不会频繁变化、数据充足能收集大量大模型的优质输出、调用量大有规模效应摊薄训练成本。一个知识库问答的场景大模型蒸馏出的小模型参数量只有 1/8在同类问题上的准确率达到大模型的 94%而推理成本只有 1/10。再加上缓存和分层单位请求成本最终降到了原来的 15%。但蒸馏不是万能药场景一变化蒸馏模型就要重新训练数据质量差蒸馏出来也是“低配版的错”。蒸馏是“规模化后的终极优化”前期先用前三板斧量上来了再考虑。六、ROI 核算降本不是目的赚钱才是成本工程做完了最后要回答的问题是“值不值”。ROI 核算框架先定义“价值单位”——这个 AI 功能替代了多少人工工时、提升了多少转化率、减少了多少客诉再算“成本单位”——上面拆解的模型成本、GPU 成本、维护人力两者一除就是 ROI。很多团队只盯着降本却忘了问“这个功能本身赚不赚钱”——如果一个功能每单都在亏钱把它做“便宜”不如把它做“有用”。一个完整的降本路径总结先核算看清账本→ 再瘦身Prompt 与上下文→ 上缓存消灭重复计算→ 做分层贵模型干贵活→ 量够了再蒸馏规模摊薄成本。每步都有明确的数据验证token 数降了多少、命中率多少、单位成本降了多少、效果掉没掉。成本工程与效果工程不是对立关系——用评测守效果用核算守成本两者一起AI 应用才能从“烧钱”走向“赚钱”。 点击大会海报免费领取大会 PPT 资料奇点智能大会 2026 将于 2026 年 11 月 20-21 日在北京万达文华酒店举办由奇点智能研究院与 CSDN 联合主办。旗下奇点智能技术大会SITS与 C及系统软件技术大会CPP-Summit双会并行第一天上午 Keynote 主会场四场主题演讲与圆桌论坛两天六大分会场覆盖 18 个前沿技术主题70 位技术专家、1000 行业精英同场交流。点击上方大会海报扫码即可免费领取大会全套 PPT 资料抢先解锁 70 专家的完整议题与干货内容。