
DeepSeek-V4-Pro-0813 正式版发布之后最值得关注的并不是“模型又更新了一次”而是它在 Agent、Coding、终端执行、自动化任务等一系列评测中的整体位置发生了明显变化。这次我把DeepSeek-V4-Pro-0813、DeepSeek-V4-Flash-0731、DeepSeek-V4-Pro-Preview、DeepSeek-V4-Flash-Preview、GLM-5.2、Kimi-K3、Opus-4.8、Fable 5放到同一张表中对比 11 项 Agent 相关 Benchmark。先说结论如果只看这组公开评测数据DeepSeek-V4-Pro-0813 已经全面超过 GLM-5.2并且基本进入当前 Agent 模型的第一梯队。但“全球第三”这个说法需要更谨慎地理解。它不是指某个统一权威榜单已经正式给 DeepSeek-V4-Pro-0813 排到全球第三而是从这组 Agent Benchmark 的综合表现来看V4 Pro 0813 已经能够稳定进入头部模型竞争区间并且在部分项目上超过 Kimi-K3、Opus-4.8 和 Fable 5。一、先看最直接的对比V4 Pro 0813 全面超过 GLM-5.2这一点其实是整张表里最明确的结论。在 GLM-5.2 已公布成绩的项目中DeepSeek-V4-Pro-0813 全部领先。HLEHLE 原表同时给出了无工具和有工具两种成绩。无工具DeepSeek-V4-Pro-081342.7GLM-5.240.5有工具DeepSeek-V4-Pro-081360.0GLM-5.254.7无论是否允许工具调用V4 Pro 0813 都领先。二、Terminal Bench 2.1已经接近最高水平Terminal Bench 2.1 主要考察模型在终端环境中的实际操作能力。成绩如下DeepSeek-V4-Pro-081387.9DeepSeek-V4-Flash-073182.7GLM-5.281.0Kimi-K388.3Opus-4.885.0Fable 588.0这一项中V4 Pro 0813 并不是第一。Kimi-K3 以 88.3 排在前面Fable 5 为 88.0。但 V4 Pro 0813 的 87.9 已经非常接近最高分同时超过了 Opus-4.8 和 GLM-5.2。换句话说在终端任务这个维度上V4 Pro 0813 已经不是“追赶者”而是直接进入头部模型竞争区间。三、NL2Repo明显超过 GLM但距离 Opus 还有差距NL2Repo 的结果比较有代表性DeepSeek-V4-Pro-081361.5DeepSeek-V4-Flash-073154.2V4-Pro-Preview38.5V4-Flash-Preview39.4GLM-5.248.9Opus-4.869.7Kimi-K3 和 Fable 5 在原表中没有公布这一项成绩。这里可以看到两个趋势。第一V4 Pro 0813 相比自己的 Preview 版本提升非常大。第二它已经明显超过 GLM-5.2但距离 Opus-4.8 依然存在差距。所以如果只看 NL2Repo还不能说 DeepSeek 已经全面达到 Opus 水平。四、CybergymV4 Pro 0813 甚至略高于 Fable 5Cybergym 是这张表中很值得注意的一项。成绩如下DeepSeek-V4-Pro-081383.3DeepSeek-V4-Flash-073176.7V4-Pro-Preview52.7V4-Flash-Preview38.7Kimi-K380.0Opus-4.878.3Fable 583.1这一项中V4 Pro 0813 拿到了83.3。不仅高于 Kimi-K3 和 Opus-4.8甚至还比 Fable 5 的 83.1 高 0.2。这说明 DeepSeek-V4-Pro-0813 在部分复杂 Agent 任务上已经具备直接拿下头部成绩的能力。五、DeepSWE正式版和 Preview 已经完全不是一个级别如果要找一个最能体现这次升级幅度的 Benchmark我会选 DeepSWE。成绩变化非常夸张V4-Flash-Preview7.3V4-Pro-Preview12.8GLM-5.246.2V4-Flash-073154.4Opus-4.858.0V4-Pro-081362.7Kimi-K367.5Fable 570.0从 V4-Pro-Preview 的 12.8 到正式版的 62.7跨度非常大。这里最值得关注的不是绝对排名而是 DeepSeek 自身版本迭代的变化。Preview 阶段的 V4 Pro 在这一项几乎没有进入头部竞争区间而 0813 正式版已经超过 Opus-4.8 和 GLM-5.2仅落后于 Kimi-K3 和 Fable 5。这已经不是常规意义上的“小版本优化”。六、Toolathlon-Verified进入第一梯队但没有拿第一Toolathlon-VerifiedDeepSeek-V4-Pro-081374.1DeepSeek-V4-Flash-073170.3V4-Pro-Preview55.9V4-Flash-Preview49.7GLM-5.259.9Kimi-K376.5Opus-4.876.2Fable 577.9这一项很能说明 V4 Pro 0813 当前的位置。它已经明显甩开 GLM-5.2 和两个 Preview 版本但 Kimi-K3、Opus-4.8、Fable 5 仍然更高。也就是说DeepSeek 已经进入第一梯队但第一梯队内部仍然存在差距。这可能是描述 V4 Pro 0813 最准确的一句话。七、Agents Last Exam和 Opus-4.8 打平Agents Last Exam 的成绩DeepSeek-V4-Pro-081325.7DeepSeek-V4-Flash-073125.2V4-Pro-Preview16.5V4-Flash-Preview15.8GLM-5.223.8Kimi-K327.6Opus-4.825.7Fable 5 没有公布这一项成绩。这里 V4 Pro 0813 和 Opus-4.8 都是 25.7Kimi-K3 为 27.6。对于 Agent 综合任务来说能够在这一项与 Opus-4.8 打平本身就说明 V4 Pro 0813 已经进入非常高的位置。八、AutomationBenchV4 Pro 0813 直接拿下当前表格最高分AutomationBench 是这次 DeepSeek 表现非常亮眼的一项。成绩DeepSeek-V4-Pro-081331.8DeepSeek-V4-Flash-073125.1V4-Pro-Preview12.8V4-Flash-Preview10.8GLM-5.212.9Kimi-K330.8Opus-4.827.2Fable 529.1V4 Pro 0813 的31.8是这张表中该项目的最高成绩。比 Kimi-K3 高 1.0比 Fable 5 高 2.7比 Opus-4.8 高 4.6。如果平时主要关注 Agent 自动化执行、工作流编排、工具链调用这个成绩很有参考价值。九、DSBench-FullStack整体已经非常接近头部模型DSBench-FullStackDeepSeek-V4-Pro-081371.1DeepSeek-V4-Flash-073168.7V4-Pro-Preview41.8V4-Flash-Preview37.0GLM-5.261.8Kimi-K373.7Opus-4.871.6Fable 577.2这里 V4 Pro 0813 与 Opus-4.8 只有 0.5 分的差距。虽然 Fable 5 仍然明显领先但从 41.8 的 Preview 到 71.1 的正式版提升已经非常明显。十、DSBench-HardOpus-4.8 仍然领先DSBench-HardDeepSeek-V4-Pro-081367.2DeepSeek-V4-Flash-073159.6V4-Pro-Preview31.1V4-Flash-Preview25.8GLM-5.254.5Kimi-K363.0Opus-4.871.7Fable 568.3这一项 V4 Pro 0813 超过 Kimi-K3 和 GLM-5.2也接近 Fable 5但 Opus-4.8 依然保持明显优势。这也是为什么不能简单把这组数据解读成“DeepSeek 已经全面超过所有模型”。十一、为什么说 V4 Pro 0813 已经全面超过 GLM-5.2把双方已公布的同项目成绩直接放在一起看BenchmarkV4 Pro 0813GLM-5.2HLE 无工具42.740.5HLE 有工具60.054.7Terminal Bench 2.187.981.0NL2Repo61.548.9DeepSWE62.746.2Toolathlon-Verified74.159.9Agents Last Exam25.723.8AutomationBench31.812.9DSBench-FullStack71.161.8DSBench-Hard67.254.5Cybergym 中 GLM-5.2 没有给出成绩因此不参与比较。从已有数据看V4 Pro 0813 在双方都公布成绩的项目中全部领先。所以“全面超过 GLM-5.2”在这张表的范围内是有数据依据的。十二、那“全球第三”这个说法成立吗这里要区分两个概念。第一单项 Benchmark 排名。V4 Pro 0813 并不是所有项目都能排第三有些项目甚至拿到第一有些项目则会落后于 Kimi-K3、Opus-4.8 或 Fable 5。第二整体竞争力。如果综合看这 11 项 Agent 相关任务V4 Pro 0813 已经非常稳定地出现在头部区间。它的特点不是“所有项目第一”而是很少出现明显短板相比 Preview 版本大幅提升全面超过 GLM-5.2多项成绩超过 Opus-4.8部分项目超过 Kimi-K3个别项目甚至超过 Fable 5。因此“全球第三”更适合作为一个讨论性的标题而不是绝对排名结论。如果一定要给它一个定位我更愿意说DeepSeek-V4-Pro-0813 已经进入全球第一梯队并且具备冲击前三的综合实力。十三、这次升级真正值得关注的是什么真正重要的其实不是某一个分数。而是 DeepSeek V4 从 Preview 到正式版之后在多种 Agent 类任务中同时完成了一次明显跃升。尤其是DeepSWE12.8 → 62.7DSBench-FullStack41.8 → 71.1DSBench-Hard31.1 → 67.2Cybergym52.7 → 83.3这些变化意味着 V4 Pro 0813 在代码工程、终端执行、Agent 工具调用、自动化任务等场景中的能力已经明显成熟。对于真正把大模型用于开发工作的用户来说这类提升往往比单纯的知识问答分数更重要。因为实际开发中最需要的不是模型“知道多少”而是它能不能理解复杂工程连续完成多步任务正确调用工具在终端环境执行操作修改代码后继续验证在长链路任务中保持稳定。从这张表来看V4 Pro 0813 在这些能力上的提升已经非常明显。总结如果只看本次公开的 Agent Benchmark 数据可以得到几个比较明确的结论。第一DeepSeek-V4-Pro-0813 已经全面超过 GLM-5.2。双方共同公布成绩的项目中V4 Pro 0813 全部领先。第二V4 Pro 0813 已经进入全球第一梯队。它在 Cybergym、AutomationBench、Terminal Bench 等项目中的成绩已经可以与 Kimi-K3、Opus-4.8、Fable 5 正面对比。第三它还没有做到全面第一。Opus-4.8、Kimi-K3、Fable 5 在不同项目中依然各有优势。第四这次最重要的变化是整体能力提升而不是单项刷榜。从 Preview 到 0813 正式版DeepSWE、Cybergym、DSBench 等多项任务同时大幅上涨这说明 DeepSeek 在 Agent 和 Coding 能力上的进步已经开始从“单点提升”变成“整体提升”。所以回到标题全面超过 GLM-5.2DeepSeek-V4-Pro-0813 全球第三“全面超过 GLM-5.2”从这张表来看基本可以确认。至于“全球第三”目前更适合作为一种综合实力判断而不是严格榜单名次。但有一点已经很明确DeepSeek-V4-Pro-0813 已经不是在追赶第一梯队而是正式进入第一梯队参与竞争了。