
Qwen3.8-9B 数学与代码能力实测从 GSM8K 到 MMLU 的评测结果全解读【免费下载链接】Qwen3.8-9B项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwen3.8-9BQwen3.8-9B 是 Empero 团队最新发布的开源推理模型它将 Qwen3.8 2.4T A95B 大模型的数学与代码推理能力蒸馏进 9B 参数的紧凑架构。本文基于官方评测数据从 GSM8K 数学推理到 MMLU 综合能力对 Qwen3.8-9B 评测结果进行逐项解读并给出部署与使用建议。这份成绩单里有惊喜也有需要理性看待的地方读完你就知道它到底值不值得上手。一、Qwen3.8-9B 是什么9B 参数如何复刻 2.4T 大模型的推理能力先说结论Qwen3.8-9B 是一棵大树上嫁接的幼苗——它不是从零训练的而是把 Qwen3.8 2.4T A95B教师模型的思维过程完整蒸馏进了 Qwen3.5-9B 的架构学生模型。蒸馏Distillation让大模型输出高质量答案和思考过程再用这些教师轨迹去训练小模型让小模型学会大模型的推理方式而不是自己瞎猜。几个关键数字项目数值参数量9B全参数微调非 LoRA 适配器教师模型Qwen3.8 2.4T A95B训练数据约 70,000 条精选教师轨迹训练方式SFT离线蒸馏上下文长度262,144 token原生支持许可证Apache-2.0可商用架构上它继承自 Qwen3.5-9B32 层 Transformer、hidden size 4096采用线性注意力与全注意力混合的 Gated DeltaNet 设计每 4 层穿插一层全注意力详见 config.json。这意味着它在长上下文场景下内存占用更友好但运行前需要安装配套的flash-linear-attention与causal_conv1d内核。最直观的特点藏在对话模板里模型每次回答都会先输出一段think.../think思维链见 chat_template.jinja再给出最终答案——这正是从教师模型那里学来的深度思考习惯。二、Qwen3.8-9B 评测方法CoT 协议与评分口径详解评测使用的是 EleutherAI 的lm-evaluation-harnessHF 后端基座模型与蒸馏模型采用完全相同的设置保证公平对比。由于两个模型都是推理模型评测采用思维链CoT协议GSM8K使用gsm8k_cot协议MMLU使用mmlu_flan_cot_zeroshot协议覆盖全部 57 个学科、约 1,700 道题。评分口径分为两档✅Flexible-extract灵活抽取只要最终答案正确就算对是主要参考指标Strict-match严格匹配要求答案格式完全一致更严苛。采样参数统一为temperature0.6, top_p0.95, top_k20Qwen3.5 官方推荐设置完整评测表见 README.md。三、GSM8K 数学推理实测准确率全解读GSM8K 是 8,500 道小学数学应用题考察模型的多步算术推理能力是衡量数学能力最常用的基准之一。Qwen3.8-9B 的成绩如下指标Qwen3.5-9B基座Qwen3.8-9B变化exact_match灵活抽取0.8850.870−0.015exact_match严格匹配0.8750.850−0.025解读87% 的准确率依然是很强的数学推理水平但相比基座模型小幅回落了 1.5 个百分点。原因并不神秘——README 中明确指出模型学习的是教师轨迹继承了教师遇到简单题也会长篇思考的习惯过度推敲反而容易在简单题上出错。也就是说这不是能力退步而是推理风格带来的副作用。四、MMLU 综合能力实测57 学科平均分暴涨 20 个点如果说 GSM8K 是小幅波动那么 MMLU 就是质的飞跃。MMLU 覆盖 STEM、人文、社科等 57 个学科是衡量大模型综合知识面与泛化能力的黄金标准指标Qwen3.5-9B基座Qwen3.8-9B变化acc灵活抽取0.5460.7510.205acc严格匹配0.2510.5110.260解读灵活抽取得分从 54.6% 飙升至 75.1%直接提升 20.5 个百分点严格匹配得分更是从 25.1% 翻倍到 51.1%。这说明蒸馏不仅教会了模型怎么想更把教师模型庞大的知识储备和严谨的作答格式搬了过来——这是 9B 参数规模下非常惊人的结果。五、为什么数学与代码是 Qwen3.8-9B 蒸馏的重点README 里有一句话很关键训练数据的配比刻意向硬核数学与竞赛编程倾斜因为这两个领域正是蒸馏在 9B 规模下性价比最高的地方。数学GSM8K 的高分证明了多步推理能力被成功继承代码模型原生支持函数调用Function Calling无需额外的工具微调即可接入代码解释器、API 等工具配合think思维链写代码时会先想清楚再动手️工具使用对话模板内置了tool_call调用格式见 chat_template.jinja适合构建 Agent 应用。一句话总结它不是为了刷分而生而是为了在单卡上跑出大模型级别的推理表现而生。六、快速部署 Qwen3.8-9B本地运行参数与注意事项想亲自复现这份评测只需几步环境要求较新的transformers支持 Qwen3.5 架构 Gated DeltaNet 内核flash-linear-attention和匹配 CUDA 的causal_conv1d下载权重文件model.safetensors与配置文件config.json、generation_config.json运行推理时务必使用推荐的采样参数。from transformers import AutoModelForCausalLM, AutoTokenizer import torch model_id empero-ai/Qwen3.8-9B tok AutoTokenizer.from_pretrained(model_id) model AutoModelForCausalLM.from_pretrained( model_id, dtypetorch.bfloat16, device_mapauto) # 关键宽松采样 足够长的输出上限 out model.generate(inputs, max_new_tokens16384, temperature0.6, top_p0.95, top_k20, do_sampleTrue)⚠️三个使用提醒不要用贪心解码推理模型在长文本生成时贪心解码greedy容易陷入重复循环务必保持采样模式留足输出长度每次回答都有think思考块建议max_new_tokens16384前端展示时记得剥离think.../think部分纯文本微调视觉能力继承自基座模型本次评测未覆盖多模态场景。七、总结Qwen3.8-9B 评测成绩单该怎么看把两份成绩单放在一起看评测维度表现结论GSM8K 数学推理87.0%灵活抽取强小幅回落属推理风格副作用MMLU 综合能力75.1%灵活抽取暴涨 20.5 个百分点最大亮点代码与工具调用原生函数调用 竞赛编程轨迹适合 Agent / 代码场景部署成本9B 单卡可跑262K 上下文性价比极高Qwen3.8-9B 的评测结果告诉我们蒸馏路线在 9B 规模上完全走得通。它用 GSM8K 的稳定表现守住了数学推理的基本盘用 MMLU 的暴涨证明了知识迁移的威力。对于想在单卡 GPU 上获得接近大模型推理体验的开发者来说这份成绩单足够有说服力。如果你正准备把它接入自己的项目建议从 README.md 的 Quickstart 开始先复现一遍 GSM8K 与 MMLU 评测再结合业务场景调整采样参数——毕竟纸面数据终归要落到真实任务里才算数。【免费下载链接】Qwen3.8-9B项目地址: https://ai.gitcode.com/hf_mirrors/empero-ai/Qwen3.8-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考