尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Maple-Preview基准测试解读:515 tokens/s预填充速度如何实现?

Maple-Preview基准测试解读:515 tokens/s预填充速度如何实现? Maple-Preview基准测试解读515 tokens/s预填充速度如何实现【免费下载链接】maple-preview-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUFMaple-Preview基准测试近日在本地推理圈引发热议一个20B参数的推理模型在纯CPU环境下跑出了515 tokens/s 的预填充Prefill速度解码速度最高也能达到 252 tokens/s。这份数据来自 HuggingFace 镜像项目 deepgrove/maple-preview-GGUF 提供的官方基准测试本文就来解读这份 Maple-Preview 基准测试拆解 515 tokens/s 预填充速度的实现原理并帮你选对适合自己的 GGUF 量化版本。先认识一下Maple-Preview 是什么Maple-Preview 是一款专为端侧设备高效推理设计的 20B-A1B 推理模型其架构要点如下24 层 Transformer采用 3:1 的 SWA-512 与 GA 注意力混合256 个专家Mixture-of-Experts每次推理只激活其中 8 个总参数 20B但每个 Token 实际只动用约 1B 参数A1B 的含义正因为全量参数少、激活参数更少它才能在普通 CPU 上获得惊人的速度。而 Maple-Preview-GGUF 项目则把这些权重打包成了 4 个 GGUF 量化版本方便直接用 llama.cpp 生态加载运行。读懂基准测试515 tokens/s 预填充速度从哪来先看官方测试条件M5 Pro 芯片、纯 CPU 推理、16 线程、512 个提示词 Token、生成 128 个 Token、重复 3 次取均值。结果如下矩阵权重LM 头精度GGUF 体积预填充 Prefill (pp512)解码 Decode (tg128)TQ1_0FP165.06 GiB515.41 ± 0.28 tokens/s161.06 ± 0.57 tokens/sTQ1_0Q4_K4.64 GiB513.33 ± 3.62 tokens/s231.13 ± 0.13 tokens/sTQ2_0FP165.91 GiB618.57 ± 2.12 tokens/s169.81 ± 2.94 tokens/sTQ2_0Q4_K5.50 GiB610.48 ± 3.76 tokens/s252.74 ± 0.37 tokens/s预填充Prefill与解码Decode分别代表什么预填充 Prefill一次性并行处理你输入的整段提示词决定首个 Token 多久出现对应首 Token 延迟解码 Decode逐 Token 串行生成回复决定每个 Token 的生成速度以 515 tokens/s 的预填充速度计算一段 512 Token 的提示词只需约 1 秒即可处理完毕几乎感觉不到等待。这也是推理模型落地本地应用时最关键的体验指标之一。515 tokens/s 预填充速度的三大技术支柱1. 三元量化Ternary QuantizationTQ1_0 与 TQ2_0这是速度的核心来源。三元量化把矩阵权重压缩到{-1, 0, 1} 三个值每个权重仅占约 12 比特模型体积和内存带宽需求都大幅下降。而 CPU 推理的速度瓶颈恰恰是内存带宽——权重越小单位时间能喂给计算单元的数据越多tokens/s 自然飙升。TQ1_0 与 TQ2_0 是两种不同的三元打包方案官方建议优先使用 TQ2_0通常速度更快但内存占用略高。2. MoE 稀疏激活256 个专家只用 8 个尽管模型总参数高达 20B但每个 Token 只激活 8/256 个专家约 1B 参数。稀疏激活让单次前向计算量大幅缩减配合三元量化才实现了 CPU 上 500 tokens/s 的预填充速度。3. 高精度 LM 头质量与速度的平衡术输出层LM head不参与三元量化而是保留Q4_K 或 FP16 高精度避免量化损伤输出质量。从测试数据能明显看到同样的矩阵权重下换用 Q4_K 头后解码速度从约 161 提升到 231 tokens/sTQ1_0 版本性价比极高。四款 GGUF 变体怎么选一份选型指南追求综合性能选maple-preview-TQ2_0-head-Q4_K.gguf5.50 GiB预填充 610 tokens/s、解码 252 tokens/s两项均为最佳最省内存选maple-preview-TQ1_0-head-Q4_K.gguf4.64 GiB体积最小解码速度依然有 231 tokens/s看重首 Token 速度选maple-preview-TQ2_0-head-F16.gguf预填充 618 tokens/s 全场最快需要最高输出精度选 TQ1_0/TQ2_0 FP16 头的组合代价是解码速度有所下降快速上手如何运行 Maple-Preview GGUF运行前请先克隆仓库包含 4 个 GGUF 文件git clone https://gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUF由于该模型使用了自定义的三元量化内核需要配合官方的 llama.cpp 定制分支编译运行详见仓库 README 中的说明然后即可像普通 GGUF 模型一样加载推理。建议在至少 8GB 内存的设备上运行16 线程的 CPU 环境能复现出接近基准测试的表现。这份 Maple-Preview 基准测试告诉我们什么515 tokens/s 预填充速度的意义不只是跑得快——它标志着推理模型在本地 CPU 设备上落地成为可能无需昂贵 GPU一台普通笔记本就能流畅运行 20B 级推理模型。官方也指出Maple-Preview 目前的预览版侧重原始推理能力在智能体Agent类任务上表现还有提升空间完整版 Maple 发布前会继续强化综合能力。如果你正在寻找一款体积小、速度快的本地推理模型不妨按本文的选型指南下载对应 GGUF 文件亲自测一测用你自己的提示词验证这份 515 tokens/s 的预填充速度。【免费下载链接】maple-preview-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表