)
本文部分内容由 AI 辅助整理所有价格、数据均标注了出处token 用量与任务消耗为公开统计 / 券商测算口径速算脚本为本机真实运行并贴出原始输出。8 月 6 日DeepSeek 在开发者后台发了条公告拟整体上调 API 服务定价预计涨幅较大。但这已经不是第一家了——从年初到现在智谱年内三次提价Kimi 随新模型直接把输出价定到每百万 token 100 元国产最高豆包把免费版转成订阅腾讯云也连涨两轮。曾经以「价格屠夫」著称的 DeepSeek 一起涨价被业内普遍解读为国产大模型价格战的拐点。但如果你只看到「厂商在涨价」可能漏掉了真正在涨的东西。这篇想从另一头算这笔账**这一波集体涨价的背后是全国 token 用量两年涨了 1000 倍而你的 AI 账单失控通常不是单价涨了是任务量涨了。**文末附一个速算工具把任务类型、次数、单价代进去几分钟看清你的账单贵在哪。一、先看热点事实这次是集体涨价不止 DeepSeek 一家把最近的调价信息排一下均为公开报道口径以各厂官方最新公告为准DeepSeek8 月 6 日拟整体上调 API 服务定价涨幅较大细则与生效时间未公布。此前已执行峰谷分时计费——工作日 9:00-12:00、14:00-18:00 高峰时段全部计费项价格翻倍深夜与周末为平峰原价。Kimi月之暗面7 月 17 日随 K3 发布输入每百万 token 20 元、输出 100 元缓存未命中口径比上一代 K2.6 输入约涨 3 倍、输出涨近 4 倍是目前国产模型里定价最高的。智谱年内三次提价一季度 API 累计提价 83%7 月底 GLM Coding Plan 套餐大幅调价Lite / Pro / Max 从 40 / 149 / 469 元涨到 118 / 538 / 1078 元最低涨幅 130%、最高超 260%。豆包6 月底推出收费的专业版从免费转向订阅制。腾讯云连续两次宣布涨价。高盛把国产大模型厂商 2026 年末合计 ARR 预期从 100 亿美元上调到 130 亿美元。券商研报普遍认为涨价是「行业从价格战回归理性定价」的信号——而价格的背后是算力成本算力成本的背后是用量。二、反常识一涨价是结果不是原因厂商为什么敢集体涨价一个常被忽略的背景数字中国日均 token 调用量从 2024 年初的约 1000 亿涨到 2026 年 3 月的 140 万亿两年增长超过 1000 倍。中国信通院副院长魏亮在央视财经《中国经济大讲堂》的公开口径国家统计局此前也公布过同一数字。单看豆包一家日均使用量 3 个月翻倍到 120 万亿 token2026 年 4 月公开报道。这不是个别公司的增长是行业级的需求爆炸。推理需求爆炸 → 高端 GPU 供不应求 → 算力成本上升 → API 价格上调。所以涨价不是「厂商贪心」更准确地说是用量把这个行业的单价抬起来了。你越是用得多行业越是涨——这个循环里单个开发者改变不了单价但可以改变「你的用量对应的成本结构」。三、反常识二一次 Agent 任务 上千次单轮对话这才是这篇最想说的点涨价涨的是单价但你的账单大头往往是任务量。券商测算东吴证券口径单轮对话只消耗数百 token而一个企业级智能体Agent完成一次复杂任务往往需要数十万到数百万 token。按量级换算一个 40 万 token 的编码 Agent 任务 ≈ 800 次单轮对话一个 400 万 token 的企业级复杂任务 ≈ 8000 次单轮对话。同样是「用 AI」以前你点一下对话框是几百 token现在 Agent 替你跑一个任务背后是几十万到几百万 token。中金的测算更直观在中等使用强度下Agent 渗透率只要到 8%它的总 token 消耗就与全部 Chatbot 相当。所以「一次 Agent 任务 上千次对话」不是比喻是量级事实。单价涨 3 倍任务量涨 1000 倍谁才是账单失控的原因一目了然。四、成本模型账单 任务数 × 单任务 token × 单价不搞复杂的模型就三笔单任务 token 输入 token 输出 token 单任务成本 输入 token × 输入单价 输出 token × 输出单价 月账单 单任务成本 × 任务次数三个变量里任务数你的业务决定Agent 化越深越大单任务 token任务复杂度决定这是最容易被忽略的「隐藏倍数」单价模型决定而且这一轮正在集体上涨。大多数人的账单失控发生在第二个变量——单任务 token 从几百涨到几十万你还没意识到。文末的脚本就是帮你把这个隐藏倍数显形。五、本地部署的产能我们实测的账算本地这笔账之前先确认产能。我们在这套环境上实测过2 台 DGX Spark 直连TP2合计 256 GB 统一内存跑 deepseek-v4-flash-0731官方 FP8 权重没有自行量化。都是我们自己机器上实测的只代表这一套环境、这一个模型版本、这一组参数不是行业通用值。单并发 84.89 tok/s八并发合计 284.80 tok/sdecode 阶段deepseek-v4-flash-0731 是稀疏 MoE 模型总参 2840 亿、每次只激活 130 亿公开资料口径所以两台 256GB 装得下、桌面机器跑得动本次实测是两台 Spark 之间网线直连没有经过存储 / 调度中枢——机器再多才需要它。本地部署的成本结构是「一次性硬件 电费运维」跟 API 单价无关你的 Agent 任务在本地跑token 不按个计费。这对「任务量大、单价又在涨」的场景是结构性的优势——而这正是前面算出来的账单大头。六、速算工具Agent 任务 token 消耗速算脚本把上面的账固化成脚本零依赖Python 3 标准库即可运行。预置了 5 档任务类型的 token 量级行业公开测算量级非本机实测输入任务类型、次数、单价输出单次与总成本、量级换算、以及本地折算时长。脚本与本文档中的真实运行输出逐字一致。#!/usr/bin/env python3 # -*- coding: utf-8 -*- Agent 任务 token 消耗速算脚本按任务类型估单次消耗乘单价算成本对比本地生成时长。 背景全国日均 token 调用量两年从约 1000 亿涨到 140 万亿信通院/统计局口径。 一个企业级 Agent 任务的 token 消耗量级是单轮对话的上千倍券商测算口径。 本脚本把「任务类型 - token 量级 - 单价 - 成本 - 本地折算」串起来帮你看清 你的账单到底贵在单价还是贵在任务量。 ⚠️ 口径声明 1. 任务 token 量级 行业公开测算量级信通院/券商口径非本机实测只用于量级感受。 2. 单价 你自己传入默认 V4 Flash 平峰价输入 1 / 输出 2 元每百万token 价格以各厂商官方最新公告为准。 3. 本地折算时长 我方实测生成速度的纯 decode 上限换算不含任务调度/多轮推理 真实任务只会更慢。 用法示例 python3 h22_agent_token_bench.py --task coding --times 100 python3 h22_agent_token_bench.py --task enterprise --times 1000 --in-price 20 --out-price 100 python3 h22_agent_token_bench.py --task coding --times -1 # 非法参数退出码 2 import argparse import sys # 任务类型 - 单次总 token输入输出量级。input/output 按 0.7/0.3 拆分。 # 量级来源东吴证券等券商口径「单轮对话数百 token企业级智能体单次复杂任务数十万至数百万 token」。 TASKS { chat: {total: 500, label: 单轮对话}, summary: {total: 10_000, label: 长文档总结}, code_review: {total: 50_000, label: 代码审查 / 补全}, coding: {total: 400_000, label: 多步编码 Agent}, enterprise: {total: 4_000_000, label: 企业级复杂任务}, } def fmt_num(n): if n 1e8: return %.1f 亿 % (n / 1e8) if n 1e4: return %.1f 万 % (n / 1e4) return str(int(n)) def fmt_dur(seconds): if seconds 3600: return %.1f 小时 % (seconds / 3600) return %.1f 分钟 % (seconds / 60) def run(task_key, times, in_price, out_price, out_ratio, local_tps, quietFalse): if task_key not in TASKS: sys.stderr.write(未知任务类型: %s可选 %s\n % (task_key, /.join(sorted(TASKS)))) sys.exit(2) if times 1: sys.stderr.write(次数必须 1收到 %s\n % times) sys.exit(2) if in_price 0 or out_price 0: sys.stderr.write(单价不能为负\n) sys.exit(2) if not (0 out_ratio 1): sys.stderr.write(输出占比必须在 (0,1)收到 %s\n % out_ratio) sys.exit(2) if local_tps 0: sys.stderr.write(本地生成速度必须 0\n) sys.exit(2) t TASKS[task_key] total t[total] out_tok int(total * out_ratio) in_tok total - out_tok per_cost (in_tok * in_price out_tok * out_price) / 1e6 total_cost per_cost * times chat_equiv total / TASKS[chat][total] # 本地折算仅输出 token 的纯 decode 时长上限我方实测速度 local_sec out_tok / local_tps local_total_sec local_sec * times if not quiet: print( * 58) print(任务类型 : %s单次 %s token % (t[label], fmt_num(total))) print(执行次数 : %d 次 % times) print(单价 : 输入 %.2f 元 / 输出 %.2f 元每百万 token % (in_price, out_price)) print(- * 58) print(单次拆解 : 输入 %s token 输出 %s token % (fmt_num(in_tok), fmt_num(out_tok))) print(单次成本 : %.4f 元 % per_cost) print(总成本 : %.2f 元%d 次 % (total_cost, times)) print(量级换算 : 一次任务 ≈ %d 次单轮对话 % round(chat_equiv)) print(- * 58) print(本地折算 : 输出 %s token按我方实测 %s tok/s 生成约需 %s纯 decode 上限 实际含任务调度只会更慢 % (fmt_num(out_tok * times), local_tps, fmt_dur(local_total_sec))) print( * 58) return {task: task_key, label: t[label], times: times, total_tok: total, in_tok: in_tok, out_tok: out_tok, per_cost: per_cost, total_cost: total_cost, chat_equiv: chat_equiv, local_total_sec: local_total_sec} def main(): ap argparse.ArgumentParser(descriptionAgent 任务 token 消耗速算) ap.add_argument(--task, defaultcoding, help任务类型: %s % /.join(sorted(TASKS))) ap.add_argument(--times, typeint, default100, help任务次数默认 100) ap.add_argument(--in-price, typefloat, default1.0, help输入单价 元/百万token默认 1) ap.add_argument(--out-price, typefloat, default2.0, help输出单价 元/百万token默认 2) ap.add_argument(--out-ratio, typefloat, default0.3, help输出 token 占比默认 0.3) ap.add_argument(--local-tps, typefloat, default84.89, help本地生成速度 tok/s默认 84.89我方单并发实测) ap.add_argument(--demo, actionstore_true, help跑内置两画像对比正文用) args ap.parse_args() if args.demo: print(『画像 A』个人开发者多步编码 Agent x 100 次V4 Flash 平峰价) run(coding, 100, 1.0, 2.0, 0.3, 84.89) print() print(『画像 B』企业级任务Kimi K3 定价 x 1000 次) run(enterprise, 1000, 20.0, 100.0, 0.3, 84.89) return 0 run(args.task, args.times, args.in_price, args.out_price, args.out_ratio, args.local_tps) return 0 if __name__ __main__: sys.exit(main())本机真跑三个用例第三个是非法参数拦截python3 h22_agent_token_bench.py --task coding --times 100 python3 h22_agent_token_bench.py --task enterprise --times 1000 --in-price 20 --out-price 100 python3 h22_agent_token_bench.py --task coding --times -1 # 次数不能为负退出码 2七、真跑同一把尺子量三张账单下面是脚本在本机真跑的输出原文贴入未修改。画像 A——个人开发者100 次多步编码 Agent按 DeepSeek V4 Flash 平峰价输入 1 / 输出 2 元每百万 token『画像 A』个人开发者多步编码 Agent x 100 次V4 Flash 平峰价 任务类型 : 多步编码 Agent单次 40.0 万 token 执行次数 : 100 次 单价 : 输入 1.00 元 / 输出 2.00 元每百万 token ---------------------------------------------------------- 单次拆解 : 输入 28.0 万 token 输出 12.0 万 token 单次成本 : 0.5200 元 总成本 : 52.00 元100 次 量级换算 : 一次任务 ≈ 800 次单轮对话 ---------------------------------------------------------- 本地折算 : 输出 1200.0 万 token按我方实测 84.89 tok/s 生成约需 39.3 小时纯 decode 上限实际含任务调度只会更慢 画像 B——同一个 1000 次企业级任务量按 Kimi K3 定价输入 20 / 输出 100 元每百万 token『画像 B』企业级任务Kimi K3 定价 x 1000 次 任务类型 : 企业级复杂任务单次 400.0 万 token 执行次数 : 1000 次 单价 : 输入 20.00 元 / 输出 100.00 元每百万 token ---------------------------------------------------------- 单次拆解 : 输入 280.0 万 token 输出 120.0 万 token 单次成本 : 176.0000 元 总成本 : 176000.00 元1000 次 量级换算 : 一次任务 ≈ 8000 次单轮对话 ---------------------------------------------------------- 本地折算 : 输出 12.0 亿 token按我方实测 84.89 tok/s 生成约需 3926.7 小时纯 decode 上限实际含任务调度只会更慢 画像 C——同一个 1000 次企业级任务量改按 V4 Flash 平峰价 任务类型 : 企业级复杂任务单次 400.0 万 token 执行次数 : 1000 次 单价 : 输入 1.00 元 / 输出 2.00 元每百万 token ---------------------------------------------------------- 单次拆解 : 输入 280.0 万 token 输出 120.0 万 token 单次成本 : 5.2000 元 总成本 : 5200.00 元1000 次 量级换算 : 一次任务 ≈ 8000 次单轮对话 ---------------------------------------------------------- 本地折算 : 输出 12.0 亿 token按我方实测 84.89 tok/s 生成约需 3926.7 小时纯 decode 上限实际含任务调度只会更慢 对比 A / B / C 能读出三层任务量从聊天级到 Agent 级单次成本上升 800 到 8000 倍——单价没变是任务量在放大账单B 和 C 是同一个任务量只换单价月账单从 176000 元变成 5200 元——同任务量下单价差约 34 倍本地折算那一行是纯 decode 上限不含任务调度。个人开发者的 100 次编码任务本地按单并发估约 39 小时——它是「生成速度」折出来的上限实际含任务调度只会更慢说明本地适合「中等任务量 私有化」的需求不是拿来顶无限量的。八、2026 年 8 月国产模型定价速查表平峰口径模型 / 套餐输入缓存未命中输出备注DeepSeek V4 Flash1 元2 元高峰时段 ×28 月 6 日已预告整体涨价DeepSeek V4 Pro3 元6 元高峰时段 ×2Kimi K320 元100 元比 K2.6 输入约涨 3 倍、输出涨近 4 倍智谱 GLM-5.2约 K3 的一半约 K3 的 1/3美元报道口径输入 1.4 / 输出 4.4 美元豆包转订阅制—6 月底专业版起收费单位元 / 每百万 token平峰价DeepSeek 高峰时段全部计费项 ×2。以上为 2026-08-08 前后媒体公开报道口径价格随时可能调整以各厂官方最新公告为准。表中 GLM-5.2 用「相对 K3 的倍数」是避免按美元汇率自行换算引入误差——报道给出的是美元价直接用倍数更稳。九、行动建议你的用量画像决定该用 API 还是本地用量小、突发、任务类型简单API 平峰调度把重活挪到深夜或周末单价最低时跑不用上本地。用量中、Agent 化深、任务量大这是单价最敏感的区间——先把速算工具里的任务量代进去算一遍再决定。单价上涨正在发生只会让本地更划算的临界用量点下降。隐私、断网或合规要求数据不能出内网本地是唯一解这时算的不是省多少钱是能不能做。用量极大每天几十亿 token 那种本地也顶不住按需选型不要硬上。十、如果你也想本地跑 Agent又不想自己折腾部署这一节是判断不是实测。前面算下来本地部署的优势集中在「任务量大 单价涨 数据要私有」这三个条件的交集。但要提醒一句完全没必要为了省 API 钱这一层把自己从开发者变成运维——自己攒机器、装框架、调显存、扛故障这套工程量对多数团队不值当。如果你想本地跑 deepseek-v4-flash-0731 这类模型又不想自己折腾部署我们的做法是把机器、模型、环境全部装好调通交付的是开箱即用的状态——拿到手就能直接用本地的模型跑你的 Agent 任务token 不按个计费数据不出内网。如果你只是想算账删掉这一节就行全文结论一字不变。小结这一轮集体涨价看单家是「厂商策略」看全行业是「用量把单价抬起来了」——token 用量两年 1000 倍算力成本迟早传导到 API 价格。而你的账单里真正的大头往往不是单价是任务量一次 Agent 任务等于上千次单轮对话这个倍数才是账单失控的地方。先看清自己的用量画像再决定用什么形态跑——这篇的速算工具和定价速查表就是帮你做这个判断的。