
开篇 · 27% 和 10% 先放在这里DeepSeek-V4 报告首页有两个数字比 1.6T 参数更值得盯住在 100 万 Token 上下文下V4-Pro 的单 Token 推理 FLOPs 约为 DeepSeek-V3.2 的 27%KV Cache 约为 10%。V4-Flash 更激进单 Token FLOPs 约为 V3.2 的 10%KV Cache 约为 7%。这两个数字听起来像是“模型突然变快了十倍”。但如果你真的把报告读完会发现它讲的不是某一个神奇算子而是一整套系统工程注意力怎么压缩、哪些历史值得检索、哪些信息只保留粗粒度摘要、缓存如何分页、通信能不能藏在计算后面、训练出问题能不能复现。我在读这份 58 页报告的时候脑子里一直有一个问题百万 Token 上下文到底是模型能力还是基础设施能力答案是二者已经分不开了。模型层面DeepSeek-V4 用 CSA 和 HCA 把历史信息压缩成不同分辨率的记忆训练层面用 mHC 和 Muon 稳住这个超大模型的信号和更新系统层面再用确定性内核、异构 KV Cache、磁盘前缀缓存、容错 Rollout 和沙箱把它接到真实 Agent 的长任务里。所以这篇文章不打算把报告按章节翻译一遍。我更想做一件事把 DeepSeek-V4 当成一套“长上下文智能系统”拆开看它为什么能把 1M 从宣传页搬到工程实践里。先把结论放在前面V4 最重要的升级不是“模型参数又变大了”而是它开始认真处理一个以前常被忽略的问题——长期记忆是有成本的模型必须学会用不同成本记住、寻找和忘记信息。01 DeepSeek-V4 到底是什么1.1 两个模型两个成本档位DeepSeek-V4 系列包含两个 Mixture-of-Experts 模型V4-Flash 和 V4-Pro。项目DeepSeek-V4-FlashDeepSeek-V4-Pro总参数284B1.6T每 Token 激活参数13B49BTransformer 层数4361原生上下文1M Token1M Token预训练数据32T Token33T Token路由专家数256384每 Token 激活路由专家66HCA 压缩率128128CSA Top-k5121024数据来自报告 Table 1、Section 4.2报告 p.24-p.28。第一次看到“1.6T 总参数、49B 激活”很多人会问那 V4-Pro 究竟是 1.6T还是 49B答案是两个都是但回答的是不同问题。1.6T 是容量。它包括所有路由专家、共享专家、注意力投影、Embedding 和预测头决定模型理论上能装下多少知识和专业变换。49B 是每 Token 的激活计算量。一个 Token 不会经过全部专家只会路由到少数专家所以单次前向的计算量更接近一个 49B 级别的稀疏模型。显存却要考虑 1.6T。所有专家的权重仍然需要被集群保存MoE 并不会让部署变成一张普通显卡能完成的事情。这三个数字拆开之后V4 的路线就清楚了用超大的总容量保留知识用较小的激活参数控制每 Token 计算再用注意力压缩解决长上下文的额外开销。1.2 V4 保留了什么重做了什么V4 没有把 Transformer 推倒重来。它保留了 Transformer、DeepSeekMoE 和 Multi-Token Prediction真正重做的是三件事序列方向用 Compressed Sparse AttentionCSA和 Heavily Compressed AttentionHCA组成混合注意力。深度方向用 Manifold-Constrained Hyper-ConnectionsmHC增强传统残差连接。优化方向用 Muon 优化器更新绝大多数矩阵参数。再往下看还有一大批系统改造MoE mega-kernel、TileLang、批次不变内核、上下文并行、异构 KV Cache、磁盘缓存、FP4 量化感知训练、可抢占 Rollout 服务和 DSec Agent 沙箱。报告里基础设施占了相当篇幅这不是为了显得工程量大而是因为架构创新会把瓶颈推到系统的别处。你把 Attention 算省了如果通信、缓存和内核接不住模型还是跑不起来。02 为什么全量 Attention 撑不起 1M2.1 普通聊天和长周期 Agent 不是一回事普通聊天的上下文通常是几十轮对话。模型读完问题生成几百个 Token任务就结束了。长周期 Agent 完全不同。它可能要读一个大型代码库、翻几十份技术文档、调用搜索和数据库工具、执行命令、观察结果、修改文件然后在数百轮交互之后仍然记得最初的目标。这些历史信息如果全部保留模型当然更容易找到证据。但代价也会跟着增长每一层都要保存历史 Token 的 Key/Value每生成一个新 Token都要和越来越长的历史做匹配训练时还要在超长序列上做反向传播显存和通信压力会一起上来。标准 Attention 的核心问题不是它“不聪明”而是它对历史的保存方式太昂贵每个 Token 都以相近的精度、相近的成本留在缓存里。这就像一个人处理一整个月的项目资料把每封邮件、每次会议、每个中间版本都原尺寸放在桌面上当然不会丢信息但很快就没有地方工作了。2.2 V4 的分层记忆DeepSeek-V4 的答案不是简单地把 Attention 换成一种新 Attention而是把历史分成三种分辨率记忆类型对应模块处理方式远处的粗粒度全局信息HCA大幅压缩后做稠密注意力远处的可检索细节CSA压缩后用索引器选 Top-k最近的局部细节SWA直接保留滑动窗口 Token这套设计很像一个分层档案系统HCA 是目录和摘要CSA 是带索引的重点材料SWA 是手边正在处理的文件。这里有一个重要的工程判断长上下文的关键不是让所有历史都保持最高分辨率而是让不同距离的信息使用不同的存储和计算预算。03 CSA先压缩再从百万 Token 里找重点3.1 压缩不是删除Compressed Sparse Attention 的第一步是把连续的多个 Token 压缩成一个 KV 条目。V4 的 CSA 压缩率设置为 4。也就是说原本每 4 个 Token 都可能对应一个独立 KV 的地方现在先生成一个压缩表示。它不是简单平均。模型会为 Key 和 Value 计算内容相关的压缩权重再加入可学习的位置偏置通过 Softmax 得到组合结果。这样压缩条目不是“这四个 Token 的平均值”而是模型自己学出来的局部摘要。报告在这里使用了一个很容易被忽视的思路压缩阶段和检索阶段是分开的。压缩阶段负责把长历史变短检索阶段负责从变短后的历史里找重点。不要因为历史被压缩了就以为模型只能看到一个模糊摘要。3.2 Lightning Indexer 做什么压缩 KV 之后CSA 通过 Lightning Indexer 为每个查询计算索引分数。它会把查询投影到低维空间和压缩后的索引 Key 做匹配然后从历史压缩块中挑出 Top-k。V4-Flash 的 Top-k 为 512V4-Pro 为 1024。这个 Top-k 不是“上下文最多只有 512 或 1024 个 Token”而是每一个查询在核心 Attention 阶段真正访问的压缩块数量。假设有 1M Token 的上下文CSA 先把它压缩到大约 1/4 的长度再让每个查询只访问其中最相关的 512 或 1024 个压缩条目。计算量自然会比让查询扫过全部历史低得多。3.3 为什么还要保留滑动窗口压缩会带来一个问题当前查询可能无法访问自己所在压缩块中的其他 Token。而语言模型恰恰非常依赖最近的局部关系。一个变量刚刚被定义下一行代码就要使用它一句话刚刚出现主语下一句就要处理代词工具刚刚返回错误模型下一步就要决定是否重试。所以 CSA 还增加了一个滑动窗口分支直接保留最近 128 个未压缩 Token。这不是和压缩路线矛盾而是对压缩的补偿远处信息可以模糊一点手边信息不能模糊。3.4 CSA 的角色如果把 V4 的注意力模块放到长周期 Agent 里CSA 更像“带索引的长期档案”。它不要求模型每一步都重新阅读整份资料而是先把资料分块再用索引器判断哪些块值得精读。报告的效率收益主要来自四件事序列压缩、Top-k 稀疏选择、共享 KV 的多查询注意力以及 FP4/FP8 混合精度存储和计算。04 HCA把更多历史压成低分辨率全局记忆4.1 HCA 和 CSA 不是两个竞争方案Heavily Compressed Attention 的压缩更加激进。V4 的 HCA 压缩率设置为 128也就是每 128 个 Token 形成一个压缩 KV 条目。它不再像 CSA 那样先 Top-k 选择而是对高度压缩后的 KV 做稠密注意力。这个设计乍看有点反直觉既然都要做稠密 Attention为什么不直接保留更多 Token因为稠密 Attention 的成本取决于它要扫描多少 KV。HCA 牺牲了历史的细节分辨率换来了非常短的全局序列。它更像一张地图你看得到整座城市的结构但不能从地图上读出每一间便利店的招牌。4.2 混合注意力的分工CSA 和 HCA 交错使用大致可以这样理解HCA 提供全局覆盖。它把很长历史压到很低分辨率保证模型不会完全失去远处的主题和结构。CSA 提供可检索细节。它保留更多压缩条目再用 Lightning Indexer 找相关片段。SWA 提供局部精度。它保护最近 Token 的细粒度依赖。这套组合拳比“所有层都用同一种注意力”复杂但更符合长任务的真实信息分布有些信息要精确找回有些信息只需要知道大概发生过有些信息则必须在眼前保持原样。4.3 位置、稳定性和 Attention SinkV4 还做了几项不太显眼、但对稳定性很重要的处理。首先CSA 和 HCA 在核心 Attention 前对查询和压缩 KV 做 RMSNorm防止注意力 Logit 爆炸。其次RoPE 只作用在最后 64 个维度并对 Attention 输出再次做相对位置处理。因为压缩 KV 同时充当 Key 和 Value输出会混入绝对位置重新处理后才能让模型更好感知“查询和历史块相距多远”。最后模型加入可学习的 Attention Sink。每个注意力头都可以把一部分概率质量放到一个虚拟汇点上而不是被迫平均分配给历史 Token。这些做法单独看都不像 headline feature但它们共同承担了一个任务让压缩后的注意力既省资源又不要在训练中失控。4.4 证据边界报告给出了 V4 与 V3.2 的整体 FLOPs 和 KV Cache 对比也给出了不同上下文长度下的曲线。但它没有完整披露 CSA/HCA 压缩率、Top-k、层间比例等组件的独立消融。因此我们能确认“整套混合注意力有效”却不能仅凭这份报告精确判断每个细节贡献了多少。这点需要记住。工程系统的整体收益不等于每一个模块都已经被单独证明不可替代。05 mHC 与 Muon一个管信号一个管更新5.1 普通残差为什么不够用了Transformer 的残差连接很简单这一层算出的结果加回上一层的隐藏状态。它的优点是稳定、便宜、容易优化。问题是所有层都沿着同一条残差流传递信息。网络变深以后浅层信息和深层信息会不断混合模型很难主动决定“这一层到底应该从哪一段历史表示开始处理”。Hyper-Connections 的思路是把残差流扩展成多条让层输入、层内变换和层输出都拥有可学习的混合映射。但普通 HC 在深层堆叠时容易出现数值不稳定。V4 使用 Manifold-Constrained Hyper-Connections也就是 mHC把残差映射矩阵约束到双随机矩阵构成的 Birkhoff 多面体上。5.2 双随机矩阵到底解决什么双随机矩阵满足三个条件每个元素非负每行之和为 1每列之和也为 1。这样约束之后残差变换的谱范数不会超过 1信号不会被层层放大。这个集合还具有乘法封闭性多层 mHC 连续堆叠时稳定性约束不会轻易丢失。工程实现上V4 先用指数函数保证矩阵元素为正再用 Sinkhorn-Knopp 算法反复做行列归一化。报告给出的实践配置是 20 次迭代。我更愿意把 mHC 理解成一种“有边界的残差自由度”它允许模型拥有多条信息通路但不允许这些通路在深层网络里无限放大。5.3 mHC 的工程账单自由度增加代价当然不会消失。mHC 会增加激活内存和流水线阶段之间的通信量。DeepSeek 团队用融合内核、选择性重计算和调整 DualPipe 1F1B 重叠策略把 mHC 的墙钟开销控制在重叠流水线阶段的 6.7%。这个数字很有价值因为它告诉我们mHC 不是“免费增强残差”。如果没有训练框架层面的重计算和流水线调整理论上的结构收益很可能会被工程开销吃掉。5.4 Muon把矩阵更新当成矩阵问题Muon 用于 V4 的大多数矩阵参数Embedding、预测头、RMSNorm 和 mHC 的静态偏置仍然使用 AdamW。Muon 的核心不是把每个参数单独调大或调小而是对更新矩阵做近似正交化。V4 使用混合 Newton-Schulz 迭代让更新矩阵的奇异值靠近 1再结合动量、Nesterov 和 RMS 重缩放完成参数更新。这样做的直觉是矩阵参数的有效更新方向不应该只由每个元素的大小决定还要考虑整个矩阵的几何结构。但 Muon 也给分布式训练带来新问题。传统 ZeRO 适合把单个参数元素分给不同 Rank而 Muon 需要完整逻辑矩阵。V4 因此设计了混合 ZeRO稠密矩阵按桶分配MoE 专家按逻辑矩阵展平和同步必要时用冗余计算换显存。5.5 一个管信息流一个管学习过程把这两个组件放在一起看组件主要问题解决方式mHC深层残差信号传播可能不稳定约束残差混合矩阵的几何性质Muon超大矩阵参数更新效率和稳定性不足对更新矩阵做近似正交化一个是在模型前向里管信号一个是在训练反向里管更新。这也是 V4 很有代表性的地方它不是只在“模型结构”上创新而是把表达能力、优化过程和硬件执行一起考虑。06 模型能设计出来不代表集群能跑起来6.1 MoE 的瓶颈经常不是 GEMMMoE 层看起来像很多个小型 FFN但 Token 需要先跨设备发送到对应专家算完之后再发回来。传统实现通常把 Dispatch、Linear-1、激活、Linear-2、Combine 分开执行。问题是通信和计算之间会出现空洞GPU 在等数据网络在等计算最终吞吐取决于最慢的一段。DeepSeek-V4 把专家拆成多个 wave。一个 wave 的专家收到数据后立刻开始计算同时下一 wave 在做 Dispatch上一 wave 在做 Combine。通信和计算被融合为一条流水线。报告在 V4-Flash 配置上给出理论加速约 1.92 倍实测相对强非融合基线通用推理加速 1.50 至 1.73 倍RL Rollout 和高速 Agent 服务最高 1.96 倍报告 p.15-p.16。6.2 真正该优化的是“计算-通信比例”报告给了一个很值得转述的判断通信是否能被隐藏关键不只看网络带宽还要看计算量和通信量的比例。对 V4-Pro一个 Token-Expert 对大约需要 6144 FLOPs却只需要约 3 Bytes 的通信。换算之后通信完全隐藏所需的平衡点约为 6144 FLOPs/Byte。这意味着当硬件带宽达到某个阈值之后继续堆网络带宽的收益会变小更值得投入的可能是计算吞吐、功耗余量和跨 GPU 的低延迟信号。这是算法报告里少见的硬件设计建议不要把“更多带宽”当成唯一答案先找到计算和通信真正匹配的平衡点。6.3 TileLang让内核开发不再是手写 CUDA 的单选题V4 的复杂架构如果直接展开会形成数百个细粒度算子。TileLang 被用来开发融合内核兼顾快速试验和运行时效率。它做的三件事很实用。第一Host Codegen 把 CPU 侧的类型、形状、步幅检查从 Python 路径移到生成的主机代码里报告称单次调用校验开销从数百微秒降到 1 微秒以内。第二TileLang 把 Z3 SMT 求解器接进整数表达式分析用来做布局推断、内存风险检查和变量形状向量化。第三它默认关闭 fast-math 和可能改变结果的近似并允许开发者显式指定 IEEE-754 行为以便训练、后训练和推理之间实现位级复现。这最后一点容易被忽略。确定性不是为了让模型更聪明而是为了让工程师知道它为什么突然不聪明。6.4 确定性是训练基础设施的一部分V4 专门实现了批次不变和确定性内核。批次不变意味着同一个 Token 放在不同批次位置输出仍然逐位一致。确定性则意味着重复计算时累加顺序固定。这会牺牲一部分看似便宜的优化。例如 split-K 可以提高小批量矩阵乘法效率但容易造成不同累加顺序稀疏 Attention 反向里的 atomicAdd 也会带来非确定性。V4 的做法是使用双内核、独立累加缓冲区、固定 Token 顺序和确定性归约把这些差异压下去。在普通在线推理里逐位一致可能不是硬要求。但在万亿参数训练里Loss Spike 出现之后如果每次复现都走不同数值路径定位问题几乎只能靠猜。07 KV Cache百万上下文的真正账本7.1 为什么不能直接套 PagedAttentionV4 的混合注意力产生了多种 KVCSA 主 KV、CSA 索引器 KV、HCA KV、滑动窗口 KV以及尚未形成完整压缩块的尾部隐藏状态。这些缓存的尺寸、更新规则、命中策略和淘汰策略都不同。传统 PagedAttention 假设各层缓存结构比较统一而 V4 把这个假设彻底打破了。V4 的缓存分成两块State Cache每个请求固定分配一块保存滑动窗口最近 Token 和尚未压缩的尾部状态。Classical KV Cache每个请求分配多个块保存已经形成的 CSA/HCA 压缩 KV 和索引器 KV。为了让不同压缩率的层能够对齐缓存块覆盖的原始 Token 数取 CSA 和 HCA 压缩率的最小公倍数。注意力内核也必须允许不同层使用不同的每块 Token 数量。7.2 共享前缀为什么值得上磁盘长文档问答和 Agent 服务里很多请求共享一个很长的前缀系统提示、代码库、政策文档、搜索结果或同一份任务材料。如果每次请求都重新 Prefill昂贵的不是生成几个新 Token而是重复处理那几万、几十万甚至上百万 Token 的共同前缀。V4 对 CSA/HCA 的压缩 KV 直接做磁盘缓存。命中共享前缀后读取完整压缩块即可尾部不完整压缩块仍需重算。滑动窗口 KV 体积约是压缩 KV 的 8 倍所以报告提供三种策略完整缓存、周期检查点和零缓存。这其实是一个很朴素的工程取舍存储多一点重算少一点存储少一点计算多一点。线上系统不可能只追求单次请求最快它要在 SSD 带宽、缓存命中率、并发隔离和重算成本之间找平衡。08 预训练模型不是在最后一步突然学会 1M8.1 数据先变长再让模型变长V4 的预训练语料超过 32T Token包含数学、代码、网页、长文档和多语言数据。报告特别强调了长文档科学论文、技术报告以及能够承载独特学术价值的材料被优先整理。这个选择与百万上下文直接相关因为长上下文能力不是只靠把短文本拼成长序列训练出来的。如果训练数据本身没有跨段落、跨章节的结构模型即使把窗口开到 1M也可能只是在更大的空间里做局部匹配。8.2 从 4K 到 1M 的长度课程V4 的训练序列长度逐步从 4K 扩展到 16K、64K 和 1M。稀疏注意力也不是从第一步就启用。Flash 前 1T Token 使用稠密注意力预热到了 64K 序列长度才引入稀疏 AttentionPro 的稠密阶段更长。这套流程可以理解为三步先让模型学会基本语言、知识和推理能力再让它适应更长的依赖和压缩表示最后在 1M 长度上训练系统与模型共同面对的真实成本。百万上下文不是训练结束时打开一个配置项而是贯穿训练课程的分布迁移。8.3 训练中的 Loss Spike万亿参数 MoE 训练并不平静。V4 团队观察到Loss Spike 与 MoE 层异常值有关路由机制还会进一步放大这些异常。他们用了两个经验方法。Anticipatory Routing。在当前步用当前主干参数计算特征但路由索引使用历史参数提前计算并缓存。系统只在检测到 Loss Spike 时短暂启用平时不承担全部额外开销。SwiGLU Clamping。把 SwiGLU 的线性分量限制在 [-10, 10]门控分量上限限制为 10直接压住极端值。报告明确承认这两种方法有效但背后的完整理论仍是开放问题。这句话反而是全文最诚实的地方之一大模型训练并不总是“理论先行、工程验证”很多时候是工程先找到稳定边界再由后续研究解释为什么。09 后训练先培养专家再合回一个模型9.1 专家不是 MoE 里的路由专家V4 后训练先针对数学、代码、Agent、指令遵循等领域训练独立专家。每个领域先做 Supervised Fine-Tuning再使用 GRPO 做领域强化学习。这里的“专家”是完整的后训练模型不是架构里每层 MoE 的 routed expert。这个区别很重要一个是模型内部的稀疏参数分支一个是后训练阶段的领域能力版本。9.2 三种 reasoning effortV4 支持 Non-think、Think High 和 Think Max。Non-think 适合日常任务和低风险决策Think High 会进行更长的逻辑分析Think Max 则把推理预算推到模型上限。它们并不只是推理时截断同一个模型。团队在 RL 阶段为不同模式设置不同的长度惩罚和上下文窗口再用think标签区分思考内容和最终回答。所以当 V4-Pro 从 Non-think 切换到 MaxHLE 从 7.7 提升到 37.7LiveCodeBench 从 56.8 提升到 93.5这不是“多给一点时间就多想一会儿”这么简单而是训练分布本身已经发生了变化。9.3 生成式奖励模型简单数学题可以用规则验证代码题可以跑测试用例。但长文写作、复杂规划、企业任务很难用一个标量规则判断。V4 不再完全依赖传统标量奖励模型而是构造带 Rubric 的 RL 数据用 Generative Reward Model 评估完整轨迹。更特别的是Actor 网络本身也参与 GRM 优化。它既生成答案也承担评价过程让模型的推理能力能够进入评分过程。这套方法的优点是减少大量人工逐条打分缺点是评价者和生成者共享能力之后如何防止自我偏置仍然需要更详细的实验说明。9.4 工具调用和持续思考V4 引入了带有|DSML|特殊 Token 的 XML 工具调用格式。报告称这种格式能减少转义失败和工具调用错误。在工具调用场景V4 会跨用户消息保留完整思考历史让长周期 Agent 不必每一轮从零恢复问题状态。普通对话则仍然会在新用户消息到来时丢弃旧思考避免无意义的上下文膨胀。另外Quick Instruction 通过专用 Token 直接复用主模型 KV Cache完成是否搜索、生成查询、判断来源权威性、识别领域和决定是否读取 URL 等辅助任务避免额外小模型重复 Prefill。10 OPD 与 FP4后训练也要为部署负责10.1 多教师在线策略蒸馏领域专家训练完成之后V4 使用多教师 On-Policy Distillation 把能力合回统一模型。学生不是拿一批固定教师答案照抄而是先用自己的策略生成轨迹再在这些轨迹上匹配多个教师的输出分布。数学任务更关注数学教师代码任务更关注代码教师。报告选择全词表 Logit 蒸馏而不是只对采样出来的单个 Token 做 KL。原因很直接完整分布提供更稳定的梯度也更忠实地保留教师对候选答案的整体判断。这一阶段最多要面对十多个教师模型每个模型都可能很大。系统不把所有教师 Logit 一次性物化而是把教师权重放到集中式存储中按需加载前向时只缓存最后一层隐藏状态训练时再经过预测头恢复完整 Logit。算法上是多教师工程上是按需加载、异步调度和显存复用。两边缺一不可。10.2 FP4 量化感知训练V4 的 FP4 QAT 主要压两个位置MoE 专家权重以及 CSA Lightning Indexer 的 QK 路径。索引分数从 FP32 压到 BF16 后Top-k 选择器加速约 2 倍同时保留 99.7% 的 KV 条目召回率。训练阶段保留 FP32 主权重量化为 FP4 后再反量化到 FP8 参与计算推理和 RL Rollout 阶段则直接用原生 FP4 权重。这样做的目的不是让论文里的数字更漂亮而是让训练、采样和线上部署尽量看到同一种数值误差。如果模型训练时用 FP8部署时突然换 FP4模型可能在采样阶段表现出训练中没见过的行为。QAT 就是在训练阶段提前把这个误差纳入模型适应范围。11 评测V4 强在哪里分数又该怎么读11.1 先看条件再看分数V4-Pro-Max 的评测覆盖知识、数学、代码、Agent 和百万上下文。知识与推理任务中Non-think、High、Max 的上下文分别为 8K、128K 和 384K形式化数学任务最多允许 500 次工具调用代码 Agent 和搜索 Agent 的最大交互步数也是 500。百万 Token 长上下文使用 MRCR 和 CorpusQA。报告还特别说明部分闭源模型 API 在大上下文查询中响应失败因此并非所有模型都能在所有项目上完成对比。这意味着评测不是裸模型之间的单一比赛而是模型、推理预算、工具、Harness、上下文管理和 API 稳定性共同参与的系统评测。11.2 V4-Pro-Max 的开放模型位置报告给出的代表性结果如下BenchmarkGemini-3.1-ProKimi-K2.6GLM-5.1V4-Pro-MaxSimpleQA Verified75.636.938.157.9Chinese-SimpleQA85.975.975.084.4GPQA Diamond94.390.586.290.1LiveCodeBench91.789.6-93.5Codeforces Rating3052--3206Apex Shortlist89.175.572.490.2MRCR 1M76.3--83.5CorpusQA 1M53.8--62.0TerminalBench 2.068.566.763.567.9SWE Verified80.680.2-80.6BrowseComp85.983.279.383.4Toolathlon48.850.040.751.8V4-Pro-Max 的画像很明确在开放模型中知识、数学、代码和工具使用都处于前列Codeforces、LiveCodeBench 和部分长上下文任务非常突出在 SimpleQA、GPQA、HLE 等知识型任务上仍落后于最强闭源模型Agent 任务接近开放模型第一梯队但尚不能宣称全面超过最强闭源模型。11.3 推理预算的影响V4-Flash 和 V4-Pro 都显示扩大 reasoning budget 会显著改变难题表现。V4-Pro 的 HLE 从 Non-think 的 7.7 提升到 Max 的 37.7MRCR 1M 从 44.7 提升到 83.5Apex Shortlist 从 9.2 提升到 90.2。这说明 V4 的重要能力不是“默认回答立刻最强”而是在给足测试时计算之后模型能否持续把额外计算转成正确性。11.4 真实任务里的表现中文功能写作中V4-Pro 相对 Gemini-3.1-Pro 的总胜率为 62.65%Gemini 胜率 34.10%。创意写作中V4 的指令遵循胜率为 60.03%写作质量胜率为 77.48%。但在高复杂度约束和多轮写作子集上Claude Opus 4.5 仍以 52.0% 对 45.9% 领先。搜索方面V4-Pro 的 Agentic Search 总胜率 61.7%RAG 胜率 18.3%。Agentic Search 平均 16.2 次工具调用比 RAG 使用更多 Prefill 和输出 Token但多数工具调用可以并行因此报告认为成本只略高。白领任务中V4-Pro-Max 对 Opus-4.6-Max 的非负率为 63%。它在任务完成和内容质量上更强但在严格格式约束、长文压缩和演示文稿视觉美感上仍有短板。内部代码 Agent 评测中V4-Pro-Max 通过率 67%接近 Opus 4.5 的 70%明显超过 Sonnet 4.5 的 47%。12 报告没有说清楚的事12.1 这不是一份完全可复现的训练日志报告披露了数据规模、模型配置和训练阶段但没有完整给出数据域比例、总训练 FLOPs、GPU 数量、训练时长和失败率。这意味着外部团队很难仅凭报告复现它的 Scaling Law也很难判断最终收益到底主要来自架构、数据质量还是训练配方。12.2 关键模块缺少独立消融报告没有完整拆出 CSA/HCA 最佳比例、mHC、Muon、Anticipatory Routing 和 SwiGLU Clamping 各自的收益。所以我们可以确认“整套系统有效”但不能轻率地说“某个单独模块贡献了全部效率”。尤其是 27% FLOPs 和 10% KV Cache是混合注意力、混合精度和缓存布局共同造成的结果不是单个 CSA 算子的成绩单。12.3 支持 1M 不等于 1M 内每个位置都同样可靠报告给出了 MRCR 1M 和 CorpusQA 1M 结果但没有提供足够完整的不同位置、不同长度和不同干扰条件下的召回曲线。所以“原生支持百万 Token”更准确的含义是模型、训练和 serving 系统可以承受百万级输入并在代表性长上下文任务上取得不错成绩它不自动等价于模型能够均匀地记住 100 万 Token 中每一条细节。12.4 开放权重不等于低门槛部署1.6T 总参数即便粗略按低精度存储也需要 TB 级权重空间还不包括量化 scale、非专家高精度权重、运行时缓冲区、KV Cache 和多机通信。V4 的开放更像是给研究机构和高端工程团队提供了透明度、可定制性和部署自由不是说普通电脑可以直接跑完整 Pro 模型。12.5 安全讨论仍然偏少报告披露了 Agent 沙箱、工具调用和若干复杂任务能力但对开放权重后的滥用防护、危险能力阈值和模型发布治理讨论不多。这并不否定架构和系统贡献但在模型能力越来越接近前沿的阶段安全和治理应该成为后续报告的固定章节而不是附带说明。结尾 · 百万 Token 不是记住更多而是记住得更有成本意识读完 DeepSeek-V4我不认为它最值得记住的地方是 1.6T、284B 或 33T 这些大数字。真正值得记住的是模型终于开始把“历史信息”当成一种有价格的资源。HCA 用很低的分辨率保留全局轮廓CSA 用索引保留可检索细节滑动窗口把最近信息放在眼前mHC 约束深层信号不爆炸Muon 约束矩阵更新别跑偏内核、缓存、磁盘和容错服务再把这些算法设计接到真实的长任务里。这是一种比“把上下文窗口改成 1M”更诚实的长上下文路线。因为真正的长上下文能力从来不是让模型永远记住一切而是让它知道什么该保留、什么该压缩、什么值得重新检索以及什么时候可以放心忘掉。百万 Token 不是模型记住了更多而是系统终于学会了怎样有成本地记住、寻找和忘记信息。你更看重模型的上下文上限还是上下文里的有效召回率欢迎在评论区聊聊。