万亿MoE大变局!Kimi K3、DeepSeek V4 Pro、GLM-5.2 终极对决,谁是开源新王?
这篇文章是对当前开源/开放权重领域的三个国产万亿级或准万亿级稀疏混合专家模型MoE—— Kimi K3、DeepSeek V4 Pro 和 GLM-5.2 进行了横向对比。三者均具备 100 万的超长上下文窗口但在模型参数、综合性能、开源许可和算力成本上面各具特色Moonshot AI 的 Kimi K3、DeepSeek V4 Pro 和智谱 AI 的 GLM-5.2 都是稀疏混合专家 (MoE) 模型拥有百万级上下文窗口。它们都面向长周期编码和智能体工作负载。本文将从人工智能团队实际决策的三个维度对它们进行比较可衡量的能力、许可条款和服务成本。“万亿参数”适用于 Kimi K3 (2.8T) 和 DeepSeek V4 Pro (1.6T)。GLM-5.2 总参数量为 744B是三者中参数总量最小的。它之所以能占据一席之地是因为在 K3 发布之前它一直是轻量级芯片领域的佼佼者。要点总结Kimi K3 在人工智能分析智能指数中领先约 57 分总排名第 3但直到 7 月 27 日仍仅提供 API 版本。DeepSeek V4 Pro 是成本最低的按标价计算每项任务约 0.04 美元每美元可产出约 115 万个 Token。GLM-5.2 (744B) 是目前最小但速度最快~168 Token/秒且可自托管的 MIT 平台。这三家公司都提供 100 万 Token 上下文目前只有 DeepSeek 和 GLM 提供开放权重。数据来源Moonshot AI、DeepSeek、智谱 AI、人工智能分析已于2026年7月18日验证。各厂商的基准测试数据使用不同的测试平台。•Marktechpost三位竞争者Kimi K3 是一个拥有 2.8 万亿个参数的稳定 LatentMoE 模型每个 Token 激活 896 个专家中的 16 个。Moonshot 尚未公布确切的激活参数数量。K3 增加了原生视觉、100 万个 Token 的上下文窗口以及始终开启的推理功能。Moonshot 称其为首个开源的 3T 级模型。我们的发布报道在此处。DeepSeek V4 Pro 是一个拥有 1.6 万亿个参数的 MoE多维数据集其中包含 490 亿个活动参数使用 384 个路由专家和一个共享专家。它拥有 100 万个 Token 的上下文窗口最大输出为 38.4 万。较小的 V4 Flash 版本总容量 284B活动参数 130B适用于成本较低的工作负载。权重信息请参见 Hugging Face。GLM-5.2 是一个拥有 7440 亿参数的 MoE 模型其中约有 400 亿个活跃参数上下文窗口大小为 100 万个 Token。智谱自带高推理模式和最大推理模式并提供 API 接口。规格Kimi K3DeepSeek V4 ProGLM-5.2总参数2.8T1.6T744B人工分析为 753B活动参数未公开16/896 位专家49B约400亿上下文窗口100万1M最大输出 384K1M最大输出 131K模态文字 视觉 视频文本文本发布时间2026年7月16日2026年4月24日2026年6月13日基准厂商报告的评分使用不同的测试平台因此各实验室的基准测试结果很少完全一致。中立的比较基准是 人工智能分析指数Artificial Analysis Index 它使用同一套测试平台对这三款软件进行评分。在该指数中 Kimi K3 得分约为 57 分 DeepSeek V4 ProMax 推理得分为 44 分GLM-5.2 得分为 51 分。K3 总体排名第三仅次于 Claude Fable 5 和 GPT-5.6 Sol与 Opus 4.8 和 GPT-5.5 相当。在 K3 发布之前GLM-5.2 一直占据着开源人工智能领域的榜首位置。编码基准测试的结果也类似但也有一些例外。Moonshot 自己的测试表使用相同的测试环境运行 K3 和 GLM-5.2。结果显示在所有共享的基准测试中K3 都大幅领先于 GLM-5.2。基准测试月之暗面测试集Kimi K3GLM-5.2DeepSWE67.546.2程序台 (ProcBench)77.863.7终端工作台 2.188.382.7FrontierSWE81.267.3瑞典马拉松 (SWE-Marathon)42.013.0自动化测试台30.812.9GPQA-钻石93.591.2DeepSeek 并未出现在 Moonshot 的表格中因此其数据来自单独的测试。 DeepSeek-V4-Pro-Max 在 SWE-bench Verified 测试中得分 80.6% 是发布时开源软件的最高得分与 Gemini 3.1 Pro 并列。它在 MRCR 1M 测试中也获得了 83.5 分证实了其强大的长上下文处理能力。GLM-5.2 在 SWE-bench Pro 测试中得分 62.1 略高于 GPT-5.5 的 58.6 分。因此就实际性能而言K3 是三者中最强的。DeepSeek V4 Pro 在独立编码任务方面具有竞争力。GLM-5.2 落后于 K3但仍然是一款性能不错的开源软件。许可这三款模型均以开放权重模型的形式发售但如今的实际应用情况却有所不同。DeepSeek V4 Pro 采用 MIT 许可 自发布之日起便在 Hugging Face 上提供权重。 GLM-5.2 也采用 MIT 许可 在 zai-org 组织下Hugging Face 上也提供完整的权重。两者现在都允许不受限制的商业用途、微调和自托管。Kimi K3 是个例外。Moonshot 承诺在 2026 年 7 月 27 日前发布权重数据预计将采用修改后的 MIT 许可协议。在此之前K3 只能通过 API 和 Kimi 应用使用。Moonshot 最近修改后的 MIT 许可协议增加了一条归属条款该条款仅在月活跃用户超过 1 亿时生效。服务成本API 列表定价将这些模式区分开来。模型输入美元/M token输出美元/M token缓存输入Kimi K33.0015.000.30DeepSeek V4 Pro0.4350.87约0.0036GLM-5.21.404.400.26DeepSeek V4 Pro 的价格优势非常明显。按标价计算1 美元大约可以购买 115 万个 V4 Pro Token22.7 万个 GLM-5.2 Token以及 6.7 万个 K3 Token。Artificial Analysis 对所有模型的定价均基于 7:2:1 的混合缓存/输入/输出比例从而消除了厂商的定价差异。在此基础上K3 的价格为每百万 Token 2.31 美元GLM-5.2 为 0.90 美元DeepSeek V4 Pro 为 0.18 美元。同一来源报告称按任务计算 K3 为 0.94 美元GLM-5.2 为 0.32 美元DeepSeek V4 Pro 为 0.04 美元 。速度方面也存在差异。Artificial Analysis 测得 GLM-5.2 的速度约为 168 个 Token/秒 远超 DeepSeek V4 Pro 和 Kimi K3 的 62 个 Token/秒左右。Moonshot 报告称在编码工作负载中缓存命中率超过 90%这使得 K3 的有效输入成本降至每百万 0.30 美元。自托管则面临不同的限制。GLM-5.2 的 744B 运算能力在 BF16 中需要超过 1TB 的显存大约相当于 8 倍 FP8 的 H200 的显存容量。DeepSeek V4 Pro 的 1.6T 运算能力则需要更多显存。Kimi K3 的硬件占用最高Moonshot 建议使用 64 个或更多加速器这使得大多数团队无法实现本地部署。K3 使用 MXFP4 权重并激活 MXFP8 以支持更广泛的硬件。数据已于2026年7月18日验证 · Moonshot AI、DeepSeek、智谱AI、人工智能分析 •Marktechpost哪种模型适用于哪种工作如果想要以最低的 Token 成本获得高质量的代码DeepSeek V4 Pro 无疑是最佳选择。它的权重数据可以下载许可证清晰透明而且输出价格低于竞争对手。就测量能力而言Kimi K3 领先但其输出价格是 GLM-5.2 的 5 到 17 倍而且要到 7 月 27 日才能下载重量数据。GLM-5.2 则介于两者之间比 K3 便宜比两个竞争对手都快现在就可以自托管而且其性能比其体积所暗示的要强。如果您计划根据验证深度和许可清晰度进行选择那么现在推荐 DeepSeek 和 GLM。而追求最高基准测试分数的买家则应等待 K3 权重发布或支付 API 溢价。原文内容kimi-k3-vs-deepseek-v4-pro-vs-glm-5-2-open-trillion-scale-moe-models-compared-on-benchmarks-license-and-serving-cost