尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Ai00 该选哪个模型?RWKV 1B6/3B/7B/14B 的 FP16/INT8/NF4 显存需求全解

Ai00 该选哪个模型?RWKV 1B6/3B/7B/14B 的 FP16/INT8/NF4 显存需求全解 Ai00 该选哪个模型RWKV 1B6/3B/7B/14B 的 FP16/INT8/NF4 显存需求全解【免费下载链接】ai00_rwkv_serverThe all-in-one RWKV runtime box with embed, RAG, AI agents, and more.项目地址: https://gitcode.com/gh_mirrors/ai/ai00_rwkv_serverAi00是一个基于 RWKV 模型的本地推理 API 服务器支持 Vulkan/Dx12/OpenGL 后端兼容 OpenAI ChatGPT API 接口内置 WebUI、Embed、RAG、BNF 采样等能力。装好 Ai00 之后新手最常遇到的第一个问题就是1B6、3B、7B、14B 模型到底选哪个FP16、INT8、NF4 量化又该怎么配这篇文章给出完整的显存对照表和选择建议帮你一次选对。一张表看懂4 个规格 × 3 种量化的显存需求以下数据来自官方实测测试环境i7-10870H RTX 4090 24G 显存默认量化所有层量化方式1B6 模型3B 模型7B 模型14B 模型FP163.2GB 显存6.5GB 显存14.4GB 显存约 29GB 显存INT82GB 显存4.4GB 显存8.2GB 显存14.8GB 显存NF41.3GB 显存2.6GB 显存5.2GB 显存10.4GB 显存 量化层数越高显存占用越低但模型效果可能变差。三种量化中INT8 的效果比 NF4 好但需要更多显存。三种量化方式是什么FP16半精度浮点不量化精度最高、效果最好显存占用最大。quant 0时即为此模式。INT88 位整数量化显存约为 FP16 的 60%效果损失很小是性价比之选。NF44 位量化显存约为 FP16 的 40%适合显存紧张但想跑更大参数的显卡。简单记忆显存够就 FP16想平衡就 INT8显存小还想跑大模型就 NF4。按你的显卡对号入座快速选模型你的显存推荐方案说明6GB 及以上3B FP16或7B NF4官方最低推荐配置3B FP16 仅需 6.5GB日常对话足够8GB7B INT88.2GB 显存质量明显优于 3B12GB14B NF4或7B FP1614B NF4 仅需 10.4GB小显存也能尝鲜大模型16GB14B INT814.8GB 显存兼顾大参数与效果24GB 及以上14B FP16约 29GB 需要双卡或更高端显卡单卡 24G 建议 14B INT8模型命名中可以直接读出参数RWKV-x060-World-3B-v2.1-20240417-ctx4096.st其中3B就是参数规模B 代表 Billions十亿详细命名规则可参考 docs/doc-models/models-name.md。如何在 Ai00 中配置模型与量化模型和量化参数都写在assets/configs/Config.toml的[model]段中只需修改三个关键项[model] name RWKV-x060-World-3B-v2.1-20240417-ctx4096.st # 模型名称只支持 .st 格式 path assets/models # 模型存放路径 quant 0 # 量化层数调高更省显存但可能损失效果 quant_type Int8 # 量化类型Int8 或 NF4换模型把.st模型文件放进assets/models/修改name即可。.st模型可从 HF 仓库直接下载官方已转换好.pth模型可用自带的converter工具转换./converter --input /path/to/model.pth。换量化改quant_type为Int8或NF4并调整quant量化层数。配置项详解见 docs/doc-guide/config.md上手步骤见 docs/doc-guide/quick-start.md。保存配置后启动 Ai00命令行出现INFO [ai00_server::middleware] model loaded即表示模型加载成功选错模型的两个常见坑共享显存会拖慢速度一旦动用了系统共享显存运行速度会变慢约 20 倍这是硬件原理不是 bug。所以请预留余量不要卡着显存上限选模型。State 文件必须与模型参数一致比如 State 文件是基于RWKV-6-World-7B微调的就必须启动 7B 模型才生效换成 3B 无效。配置完成后的效果验证打开浏览器访问http://localhost:65530进入 WebUI 即可直接对话、续写、写论文右侧还可调整 Temperature、Top_P 等解码参数下面是 3B/7B 模型在对话模式下的实际效果演示小结显存 ≥8GB首选 7B INT8效果与显存的平衡点。显存 6GB3B FP16 或 3B INT8官方最低推荐配置。显存 12~16GB14B NF4/INT8用 4 位量化换取更大参数。追求最佳效果14B FP16约 29GB 显存或 7B FP1614.4GB。配置完成后你还可以参考 docs/doc-models/state-model.md 挂载 State 文件、通过 OpenAI 兼容接口接入自己的应用完整释放所选模型的潜力。【免费下载链接】ai00_rwkv_serverThe all-in-one RWKV runtime box with embed, RAG, AI agents, and more.项目地址: https://gitcode.com/gh_mirrors/ai/ai00_rwkv_server创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表