
DeepSeek-V4-Pro-MXFP4是什么一文读懂AMD官方MXFP4量化大模型的架构与核心优势【免费下载链接】DeepSeek-V4-Pro-MXFP4项目地址: https://ai.gitcode.com/hf_mirrors/amd/DeepSeek-V4-Pro-MXFP4DeepSeek-V4-Pro-MXFP4是 AMD 官方基于 DeepSeek-V4-Pro 深度量化而成的 MXFP4 大模型专为 AMD MI350 / MI355gfx950平台优化采用 OCP MXFP4 格式压缩 MoE 专家权重在 GSM8K 测试中恢复原模型99.0%的精度同时显著降低显存占用与推理成本。如果你正在寻找能跑在 AMD 显卡上的 DeepSeek 大模型或者想了解 MXFP4 量化大模型到底值不值得用这篇文章将为你一次性讲透它的架构、量化策略与部署方法。为什么需要MXFP4量化大模型大模型动辄数百 GB 的权重让普通用户和中小企业望而却步。量化Quantization就是把模型的浮点权重用更少位数的格式存储从而大幅压缩体积、提升推理速度。数据格式位数典型用途体积对比相对BF16BF1616 bit原始模型1.0xFP88 bit主流量化0.5xMXFP44 bit极致压缩约 0.25xMXFP4 是 OCP开放计算项目制定的Microscaling微缩放格式它的精髓在于用一个共享的 8 位缩放因子e8m0管理一小块数据从而在 4 位宽度下依然保留足够动态范围。AMD 通过自家量化工具AMD-Quarkv0.12.0将这一格式落地到 DeepSeek-V4-Pro 上诞生了本项目的 MXFP4 量化大模型。DeepSeek-V4-Pro-MXFP4架构速览MoE与超长上下文要理解这个量化版本先要认识它的底子——DeepSeek-V4-Pro 本身的架构。核心配置记录在仓库根目录的config.json中61 层 Transformer 3 层哈希层隐藏维度 7168384 个路由专家 1 个共享专家每次只激活 6 个专家MoE 混合专家架构128 个注意力头支持滑动窗口注意力与压缩注意力原生 65K 上下文经 YaRN 扩展后支持高达 104 万 token约 100 万级超长上下文词表大小 129280支持文本输入输出MoE 架构是这套方案的命门384 个专家占据了模型绝大部分参数是体积最大的部分也因此成为量化收益最高的目标。仓库内的 64 个权重分片文件model-00001-of-00064.safetensors至model-00064-of-00064.safetensors就是量化后的成果由model.safetensors.index.json统一索引。哪些层被量化了AMD的选择性量化策略AMD 没有一刀切量化整个模型而是采用了一套相当精细的选择性量化策略这在量化配置config.json的quantization_config中体现得淋漓尽致✅被量化的部分全部路由专家 共享专家的投影层权重采用MXFP4 静态量化激活采用MXFP4 动态量化按 32 元素分组的 per-block 缩放⏸️保持原精度的部分注意力层、MoE 路由门控、归一化层、词嵌入、输出头以及 MTP多 token 预测模块全部以 BF16 原精度保留这样做的原因很朴素专家层参数最多、且是 MoE 推理的吞吐瓶颈量化收益最大而路由门控和注意力对精度极其敏感保留原精度能守住模型能力。文件config.json中长达数百行的exclude列表正是这份取舍清单的完整记录。量化后精度还剩多少GSM8K实测99%恢复量化最让人担心的就是掉精度。AMD 官方在 GSM8K8-shot严格匹配基准上给出了对比数据基准DeepSeek-V4-Pro原始DeepSeek-V4-Pro-MXFP4量化精度恢复率GSM8Kstrict-match94.9093.699.0%GSM8K 是考验数学推理能力的经典基准能恢复99%的原始精度说明 MXFP4 量化大模型在省一半以上显存的同时几乎没有感知得到的能力损失。对大多数推理与对话场景来说这是一个非常划算的交换。如何用vLLM在AMD MI350上部署MXFP4量化模型该模型依托vLLM推理引擎运行官方推荐基于 ROCm 的 Docker 镜像rocm/vllm-dev:nightly_main_20260714。整体流程如下克隆仓库包含量化权重与推理配置git clone https://gitcode.com/hf_mirrors/amd/DeepSeek-V4-Pro-MXFP4启动 vLLM 服务开启 AMD 专属的 AITER 加速与共享专家融合export VLLM_ROCM_USE_AITER1 export VLLM_ROCM_USE_AITER_FUSION_SHARED_EXPERTS1 vllm serve amd/DeepSeek-V4-Pro-MXFP4 --tensor-parallel-size 4 \ --kv-cache-dtype fp8 --trust-remote-code --tokenizer-mode deepseek_v4配套环境为 ROCm 7.2.0、PyTorch 2.9.1、Transformers 5.13.1并需在 Linux 系统上运行。对于没有 vLLM 环境的开发者仓库还内置了一套轻量级推理实现可供参考见下文。仓库里有什么从量化配置到推理代码除了权重这个仓库还贴心地提供了完整的技术资料config.json完整模型配置与 MXFP4 量化参数含全局量化配置与逐层覆盖generation_config.json文本生成的采样参数inference/自研推理实现包含权重转换脚本convert.py、交互/批量生成脚本generate.py、核心算子kernel.py与模型定义model.py支持 FP4/FP8 专家并支持多节点分布式推理encoding/分词编码验证工具encoding_dsv4.py及配套测试样例tests/test_input_*.json与tests/test_output_*.txtREADME.md官方英文文档含量化脚本、部署命令与评测复现步骤对想深入理解 MXFP4 落地细节的开发者config.json里的quantization_config与inference/kernel.py中的 FP4 GEMM 实现都是极佳的学习素材。适合谁使用一句话总结追求性价比的开发者想在 AMD 显卡上以更低显存跑起 DeepSeek-V4 级别模型MXFP4 量化大模型是现成方案模型推理部署团队需要超长上下文 MoE 推理吞吐且可接受 99% 精度恢复率的工程取舍量化技术爱好者想研究 OCP MXFP4 格式与选择性专家量化策略的实战案例简单来说DeepSeek-V4-Pro-MXFP4 是AMD 官方出品、MXFP4 极致压缩、99% 精度恢复、专为 MI350 优化的 DeepSeek 大模型量化版本。它遵循上游 MIT 许可证可自由使用与二次开发——如果你正为 AMD 平台的 DeepSeek 部署发愁不妨从克隆这个仓库开始。【免费下载链接】DeepSeek-V4-Pro-MXFP4项目地址: https://ai.gitcode.com/hf_mirrors/amd/DeepSeek-V4-Pro-MXFP4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考