尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

DeepSeek-V3 全景解析:用 6 个量化信号反推未公开的预训练数据分布

DeepSeek-V3 全景解析:用 6 个量化信号反推未公开的预训练数据分布 DeepSeek-V3 全景解析用 6 个量化信号反推未公开的预训练数据分布【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3你可能正在为一个「中文对话 代码补全 数学推理」混合的系统评估 DeepSeek-V3但遇到一个共性困惑官方 README 只说了 14.8 万亿Ttokens 的预训练数据数据分布的语言占比与领域构成完全空白。这是一个 671B 参数的 MoE混合专家架构可理解为按需激活一部分专家网络大语言模型数据配方不会随权重一起开源。 第一个信号就很反直觉它每个 token 只激活约 37B 参数总量的 5.5%却能在 MMLU87.1 vs 84.4与 BBH87.5 vs 82.9上击败全参数激活的 LLaMA-3.1 405B。接下来我们逐一拆解 6 个可观测信号所有推断均会明确标注为推断。如何从 3 个基准锚点反推语言数据分布语言构成是未公开细节中最容易交叉验证的一项因为不同语言的基准测试天然构成锚点。反推步骤如何从 MMLU 分数推断语料占比取基座模型的三个锚点英语 MMLU 87.1、中文 C-Eval 90.1、非英语 MMMLU 79.4。对照同级模型——Qwen2.5-72B 为 85.0 / 89.2 / 74.8LLaMA-3.1-405B 为 84.4 / 72.5 / 73.8——可见它在英语与中文锚点上同时领先非英语锚点优势相对收窄。合理猜测是英语语料占主体大概率过半中文数据约占 20%–30%日语、西语、法语等其他语言合计约 10%–20%。这个推断的边界要讲清楚MMMLU 非英语 79.4 比中文锚点低约 11 分既可能是低资源语言占比不高也可能是质量参差单凭分数无法区分。旁证藏在 inference/configs/config_671B.json 里vocab_size 达到 129280。如此大的词表通常要覆盖大量文字体系或字节级回退 token与多语言分词、中英为主的猜测互相印证。这意味着……三个分数锚点加一个词表参数指向同一结论语料并非所有语言均摊而是有明显头尾的梯度分布。从 256 专家 × top-8 路由到 14.8T tokensconfig 文件里的隐藏指纹语言分布回答了是什么数据却没有回答数据有多细、有多杂。671B 主模型的配置给出了半个答案n_routed_experts: 256, n_activated_experts: 8, n_expert_groups: 8, n_limited_groups: 4, n_dense_layers: 3每个 token 激活 256 个路由专家中的 8 个另有 1 个共享专家兜底61 层里只有前 3 层是稠密层。这种结构对数据分布的窄毫无容忍度14.8T tokens 若领域粒度不足专家分工会退化为同质化复制。官方技术报告提到该模型采用无辅助损失auxiliary-loss-free的负载均衡策略以路由约束替代传统辅助损失项——成绩暗示数据混合必须足够细粒度让每个专家都能找到自己的亲和域。再叠加 5.5% 的激活比与 2.664M H800 GPU 小时的预训练开销单位算力吞吐的数据量极大合理猜测是依赖大规模、高质量混洗语料才消化得动。这意味着……MoE 的参数规模本质上是对数据粒度的押注256 个专家是在按语言、领域、难度切分 14.8T tokens而非按单一主题。FP8 训练稳定性与 128K NIAH 全绿2 个可观测的数据质量信号押注大规模细粒度混洗后训练稳定性就成了可检验的副产品。最反直觉的数是成本2.664M H800 GPU 小时完成 14.8T tokens 预训练且 README 强调全程未出现不可恢复的损失峰值、未做过任何回滚。对一个原生 FP88 位浮点训练的模型而言这种稳定性本身就是数据信号——e4m3 格式动态范围窄若语料中存在大量离群脏样本损失尖峰几乎必然出现。由此可反推上游清洗去重、质量过滤相当彻底。这是推断而非官方陈述但权重格式留下了可核查的痕迹quantization_config: { activation_scheme: dynamic, fmt: e4m3, weight_block_size: [128, 128] }128×128 分块缩放与反量化细节见 README_WEIGHTS.md。官方只提供 FP8 权重需要 BF16 实验时可用 inference/fp8_cast_bf16.py 转换。第二个稳定性信号来自 NIAHNeedle In A Haystack即在长文档中找一句被埋没的话测试2K 到 128K 上下文长度 × 全部文档深度均为全绿说明 128K 上下文窗口不是名义值训练语料中的长文档数据确实生效源文件figures/niah.png这意味着……训练稳定性与长上下文能力共同构成数据质量的双向证明语料够干净长文本也占了一席之地。DeepSeek-V3 基准测试分析从图表读出分数优势集中在哪稳定性是必要条件而非充分条件最终仍要看分数分布。把基准成绩按任务类型拆开优势分布极不均匀六项指标中 V3 在竞赛数学与竞赛编程三项明显领先AIME 与 Codeforces 优势最大落后三项里 MMLU-Pro 仅比 Claude-3.5 低 2.1 分源文件figures/benchmark.png具体看AIME 2024 得 39.2比第二名的 23.3 高 15.9 分是 GPT-4o9.3的 4 倍多Codeforces 排名 51.6 分位比上代 V2.535.6高 16.0 分MATH-500 拿 90.2。落后侧差距有限MMLU-Pro 75.9-2.1 分、GPQA-Diamond 59.1-5.9 分、SWE-bench Verified 42.0-8.8 分。这种分布模式暗示数据策略是向数学题库与代码仓库这类结构化语料集中投入百科类知识密度相对轻。再结合基座 MATH 61.6、对话模型 MATH-500 90.2 与 CNMO 2024中文竞赛数学43.2可反推中文数学语料也有一定占比并非英语语料的简单翻译。这意味着……选型时若场景偏【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表