尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

k-quant为什么更强?Llama-2-7B-Chat-GGML中Q4_K、Q5_K、Q6_K量化原理深度解析

k-quant为什么更强?Llama-2-7B-Chat-GGML中Q4_K、Q5_K、Q6_K量化原理深度解析 k-quant为什么更强Llama-2-7B-Chat-GGML中Q4_K、Q5_K、Q6_K量化原理深度解析【免费下载链接】Llama-2-7B-Chat-GGML项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/Llama-2-7B-Chat-GGML在本地运行大语言模型时量化是决定能不能跑得动的关键技术。Llama-2-7B-Chat-GGML 仓库提供了从 2-bit 到 8-bit 的全套 GGML 量化模型其中 Q4_K、Q5_K、Q6_K 这类k-quant 量化文件是普通用户跑 Llama-2-7B-Chat 的首选它们用更少的显存/内存换来了比传统量化高得多的精度。本文带你从零看懂 k-quant 到底强在哪里以及如何挑对适合自己的量化文件。一、量化是什么为什么需要它 一句话理解量化 给模型瘦身把高精度的权重数字压缩成低精度数字。Llama-2-7B 原版模型以 16-bitfp16存储体积超过 13 GB普通电脑很难带动。量化把每个权重压缩到 8-bit、6-bit、甚至 4-bit模型体积随之缩小数倍内存占用大幅下降量化精度典型文件体积运行所需最大内存8-bit (q8_0)7.16 GB9.66 GB6-bit (q6_K)5.53 GB8.03 GB5-bit (q5_K_M)4.78 GB7.28 GB4-bit (q4_K_M)4.08 GB6.58 GB2-bit (q2_K)2.87 GB5.37 GB位宽越低文件越小、跑得越快但精度损失也越大。如何在小和准之间找到最佳平衡点这正是 k-quant 出场的地方。二、k-quant 为什么更强——超块结构揭秘传统量化如 q4_0对一整块权重使用同一套缩放参数相当于一刀切权重分布平坦的区块用着浪费分布剧烈的区块又欠拟合。k-quantk-quantization的核心创新是两级分组的超块super-block结构小块block每 16~32 个权重为一组各自拥有独立的缩放因子和最小值min超块super-block多个小块再打包成一个超块超块内的缩放因子本身还会被进一步量化如 4-bit、6-bit、8-bit。打个比方 传统量化像整箱商品统一标价而 k-quant 像每小袋商品单独称重、整箱再统一压缩包装——分组更细、误差更小同时整体体积控制得更好。这就是同样标称 4-bit 时q4_K 精度普遍高于 q4_0 的根本原因。三、Q4_K 深度解析4-bit 性价比之王结构超块包含8 个小块每块 32 个权重缩放因子和最小值均以6-bit量化实际位宽约4.5 bpwbits per weight代表文件llama-2-7b-chat.ggmlv3.q4_K_M.bin4.08 GB需约 6.58 GB 内存Q4_K 系列还有两个变体区别在于对关键张量区别对待文件策略体积llama-2-7b-chat.ggmlv3.q4_K_S.bin全部张量用 q4_K3.83 GBllama-2-7b-chat.ggmlv3.q4_K_M.binattention.wv、feed_forward.w2 的一半改用 q6_K其余 q4_K4.08 GBM 版Medium把更贵的 6-bit 量化预算优先花在敏感张量上注意力输出与 FFN 投影层是 4-bit 档综合表现最佳的选择也是多数场景的推荐默认值。四、Q5_K 深度解析5-bit 精度进阶结构与 Q4_K 完全相同的超块结构8 块 × 32 权重6-bit 缩放只是每个权重多用 1 bit实际位宽约5.5 bpw代表文件llama-2-7b-chat.ggmlv3.q5_K_M.bin4.78 GB需约 7.28 GB 内存变体说明文件策略体积llama-2-7b-chat.ggmlv3.q5_K_S.bin全部张量用 q5_K4.65 GBllama-2-7b-chat.ggmlv3.q5_K_M.binattention.wv、feed_forward.w2 的一半改用 q6_K其余 q5_K4.78 GB如何选择如果你的内存能在 4-bit 基础上再挤出一小截约多 0.7 GBq5_K_M 在数学、代码、长文本等对细节敏感的任务上会明显更稳。适合内存够用、追求质量的用户。五、Q6_K 深度解析接近原版的 6-bit 高精度结构超块包含16 个小块每块 16 个权重缩放因子以8-bit量化实际位宽约6.5625 bpw代表文件llama-2-7b-chat.ggmlv3.q6_K.bin5.53 GB需约 8.03 GB 内存Q6_K 是所有 k-quant 中精度最高的一档与 16-bit 原版差距已很小同时比 q8_07.16 GB更小、更快还支持 2~6 bit 的加速点积运算。当内存有 8 GB 以上可用时q6_K 是质量优先用户的最优解接近无损体验。六、文件怎么选一张表看懂 仓库内全部量化文件一览摘自 README.md 的 Provided files 章节文件量化方法位宽体积定位llama-2-7b-chat.ggmlv3.q2_K.binq2_K22.87 GB极限低内存质量损失明显llama-2-7b-chat.ggmlv3.q3_K_S.binq3_K_S32.95 GB低内存入门llama-2-7b-chat.ggmlv3.q3_K_M.binq3_K_M33.28 GB低内存进阶llama-2-7b-chat.ggmlv3.q3_K_L.binq3_K_L33.60 GB低内存高质部分张量用 q5_Kllama-2-7b-chat.ggmlv3.q4_K_S.binq4_K_S43.83 GB4-bit 紧凑版llama-2-7b-chat.ggmlv3.q4_K_M.binq4_K_M44.08 GB⭐ 4-bit 首选性价比之王llama-2-7b-chat.ggmlv3.q5_K_S.binq5_K_S54.65 GB5-bit 紧凑版llama-2-7b-chat.ggmlv3.q5_K_M.binq5_K_M54.78 GB⭐ 5-bit 首选质量更稳llama-2-7b-chat.ggmlv3.q6_K.binq6_K65.53 GB⭐ 质量优先接近原版llama-2-7b-chat.ggmlv3.q8_0.binq8_087.16 GB近似无损占资源多快速决策指南内存紧张 6 GB→q4_K_M或更低档内存适中6~7.5 GB→q4_K_M/q5_K_M内存充足≥ 8 GB→q6_K体验接近原版七、快速上手用 llama.cpp 跑起来下载好模型后例如llama-2-7b-chat.ggmlv3.q4_K_M.bin用 llama.cpp 一条命令即可启动./main -t 10 -ngl 32 -m llama-2-7b-chat.ggmlv3.q4_K_M.bin --color -c 2048 --temp 0.7 --repeat_penalty 1.1 -n -1 -i -ins关键参数说明-t 10CPU 物理核心线程数按自己机器调整-ngl 32卸载到 GPU 的层数无独立显卡可删除-c 2048上下文长度Llama 2 原生支持 4096可调大-i -ins进入交互式聊天模式Chat 版模型专用⚠️ 注意GGML 格式已被 GGUF 取代2023-08-21 之后的 llama.cpp 不再支持 GGML 模型。若要使用新版 llama.cpp请改用官方 GGUF 格式仓库详见 README.md 的 Compatibility 章节。八、常见问题 FAQQ1Q4_K_M 和 Q5_K_S 体积几乎一样选哪个优先选q4_K_M。它把预算集中花在敏感张量部分 q6_K而 q5_K_S 是全场均匀加 1 bit前者精度利用更高效。Q2S / M / L 后缀到底什么意思S Small全部张量同一种量化、M Medium敏感张量一半升级、L Large敏感张量更大量升级如 q3_K_L 用 q5_K 增强 attention.wv/wo 和 feed_forward.w2。预算允许时M 通常是最优性价比。Q3k-quant 的实际位宽为什么不是整数因为缩放因子和 min 本身也占位。例如 q4_K 标称 4-bit但 6-bit 缩放 元数据摊下来约 4.5 bpwq6_K 摊下来约 6.5625 bpw。这解释了为什么6-bit 的 q6_K比直觉中略大。Q42-bit / 3-bit 文件能日常使用吗q2_K2.5625 bpw和q3_K3.4375 bpw适合极限低内存场景的能跑就行但生成质量损失明显不建议作为主力档位。九、总结k-quant 强在超块两级分组小块独立缩放 超块压缩元数据同位宽下精度全面领先传统量化Q4_K4.5 bpw 4-bit 档性价比之王q4_K_M是多数人的默认选择Q5_K5.5 bpw 内存宽裕时的稳准之选Q6_K6.5625 bpw 内存充足时接近原版的无损体验结合 config.json 可知模型类型为 llama模型使用条款请参见 LICENSE 与 USE_POLICY.md选对量化档位普通电脑也能流畅驾驭 Llama-2-7B-Chat 【免费下载链接】Llama-2-7B-Chat-GGML项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/Llama-2-7B-Chat-GGML创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表