尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

揭秘开源大模型的数据配比:从DeepSeek-V3成绩单反推它的训练食谱

揭秘开源大模型的数据配比:从DeepSeek-V3成绩单反推它的训练食谱 揭秘开源大模型的数据配比从DeepSeek-V3成绩单反推它的训练食谱【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3你有没有好奇过同一个模型用中文跟它聊编程它对答如流换成低资源语言提问它却常常答非所问差别不在参数规模而在它吃过的数据里。DeepSeek-V3这个拥有671B参数的混合专家MoE开源大模型靠14.8万亿tokens的食材练就了中英文通吃的本领也把能力边界明明白白写进了数据配比。先认识这盘菜DeepSeek-V3的开源身份很特殊总参数671B每次推理却只激活37B是典型的花小钱办大事架构整个预训练只烧掉约266万H800 GPU小时比同规模模型低一个量级。但比起怎么炼成的更值得琢磨的是它喂了些什么——因为数据构成决定了能力的天花板。 语言成绩的梯度就是数据配比的投影官方并没有公布各语言的精确占比但这不妨碍我们尝出来。把预训练数据比作菜谱模型就是出锅的菜肴——你尝不出每味佐料的分量却能从味道反推大厨的偏好。评测成绩就是最直接的味觉测试。先看英语这盘主菜MMLU拿到87.1%BBH冲到87.5%。这两张卷子覆盖世界知识与多步推理能在上面拿高分说明英语语料占了绝对大头——学术文献、维基百科、代码注释都以英语为主业内普遍推测其占比超过一半。再看中文这碟招牌菜C-Eval 90.1%、CMMLU 88.8%不仅不输英语甚至在部分维度反超。这暗示中文语料占比相当可观推测在20%30%来源横跨新闻、书籍与网络文本。最后是配菜多语言MMMLU-non-English仅有79.4%比中英文低了近10个百分点。日语、西语、法语虽有所覆盖但分量明显不足。成绩的梯度就这样一格格地还原了数据的配比。 数学与代码双开花数据配比埋下的伏笔语言配比只是表层数据构成更深的影响藏在能力结构里。数学是DeepSeek-V3最锋利的一把刀基础版GSM8K 89.3%、MATH 61.6%对话版在MATH-500上更是拿下90.2%。没有海量数学题解和推理文本垫底仅凭聪明是撑不起这个分数的。代码同理——HumanEval 65.2%、MBPP 75.4%CRUXEval双向理解都接近70%背后是GitHub等代码库的大规模纳入。但能力也有偏科TriviaQA 82.9%与NaturalQuestions 40.0%之间隔着近43个百分点说明模型擅长在给定文章里找答案对开放域事实问答却力不从心——百科类语料深度有余、广度不足。这张多模型对比图里DeepSeek-V3在数学与代码上的领先正是数据配比最直观的注脚。⚖️ 清洗数据本质是一场留与弃的取舍14.8万亿tokens不是一股脑灌进去的。去重、质量打分、领域配比动态调整——这些流程的核心问题只有一个哪些token值得吃掉哪些必须倒掉选择必然伴随代价。质量过滤的标准更偏向主流语料意味着小语种文本更容易被误伤这正是低资源语言表现平平的原因之一。另一个细节官方只提供FP8权重想要BF16还得用转换脚本自己动手见inference/fp8_cast_bf16.py——为了训练效率做的精度取舍也延续到了部署环节。 给开发者的数据地图什么时候直接用什么时候微调读懂数据配比最终是为了用对模型中英文对话、代码补全、数学推理开箱即用成绩已验证低资源语言、高度专业的医疗与法律场景先做领域微调别指望原汤里自带这些味长文档处理128K上下文内的NIAH测试几乎全绿可以放心用。热力图几乎全绿说明长文本数据在预训练中得到了充分入味。回到开头的悬念中英文通吃、其他语言乏力答案早就写在了数据配比里。而下一个问题是——优质语料正在快速枯竭当食材越来越贵下一代大模型该从哪里找饭MTP多token预测这类新训练目标能进一步榨干现有数据的潜力但数据从哪来终将成为所有大模型共同的课题。想亲手验证这份食谱克隆 https://gitcode.com/GitHub_Trending/de/DeepSeek-V3 仓库按inference/下的说明跑起demo或翻阅README_WEIGHTS.md了解权重细节你会对数据配比有更直观的体感。【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表