
10分钟上手ExLlamaV3新手入门安装与首次运行完整指南【免费下载链接】exllamav3An optimized quantization and inference library for running LLMs locally on modern consumer-class GPUs项目地址: https://gitcode.com/gh_mirrors/ex/exllamav3想在消费级显卡上快速运行本地大模型ExLlamaV3是一款专为现代消费级 GPU 优化的LLM 量化与推理库支持 EXL3 量化格式、张量并行、推测解码和多模态。本指南将带你完成安装、模型转换和首次对话全程约 10 分钟。为什么选择 ExLlamaV3ExLlamaV3 的核心亮点EXL3 量化格式基于 QTIP 改进单张 RTX 4090 即可在几小时内核化 70B 模型⚡灵活的并行推理张量并行 专家并行适合多卡消费级硬件OpenAI 兼容服务通过 TabbyAPI 提供标准 API 接口️多模态支持Gemma、Qwen-VL、GLM-V 等视觉模型生态完善支持 LoRA、连续批处理、2-8 bit 缓存量化、HF Transformers 插件支持的模型架构非常丰富包括 Llama 3/3.1/3.2、Qwen 2/3 系列、Mistral、Gemma 2/3、DeepSeek V3/V4、GLM 4、Phi 等完整清单可在 exllamav3/architecture/architectures.py 中查看。安装前准备环境检查清单开始之前请确认以下环境依赖项要求说明CUDA 驱动12.4 或更高消费级 NVIDIA GPU 即可PyTorch需手动安装匹配版本pip不会自动处理 Torch 依赖Python3.10 推荐与 Torch 版本匹配 提示PyTorch 版本务必与你的 CUDA 版本对应这是新手最常见的坑。依赖清单见 requirements.txt含tokenizers、safetensors、ninja等。ExLlamaV3 三种安装方法方法一预编译 wheel新手推荐⭐最省事的方式无需编译环境pip install releases 页面的 .whl 文件地址选择与你 Python 版本和 CUDA 版本匹配的 wheel 包即可如cp313cu128.torch2.8.0。方法二从 PyPi 安装pip install exllamav3⚠️ 注意PyPi 包不含预编译扩展需要本机具备 CUDA 工具链和编译工具Windows 需 VS Build ToolsLinux 需 gcc 及 python-dev 头文件。方法三从源码构建git clone https://gitcode.com/gh_mirrors/ex/exllamav3 cd exllamav3 pip install -r requirements.txt pip install .构建时的两个实用环境变量MAX_JOBSninja 默认编译进程过多可能导致内存不足可设为4等合理值EXLLAMA_NOCOMPILE设为非零值可跳过 C/CUDA 扩展编译改由 Torch 在运行时编译加载EXL3 量化为什么它能以小博大EXL3 是 QTIP 的精简变体使用**程序化码本procedural codebook**将高维向量编码为最优的尾咬接格结构与传统 SOTA 量化方法相比EXL3 的转换只需输入模型 目标比特率两个参数通过在线计算 Hessian 矩阵和融合 Viterbi 内核小模型几分钟、70B 级别几小时即可完成单张 RTX 4090。官方给出的实测数据同样惊人Llama-3.1-70B-EXL3 在 1.6 bpw 下仍能保持连贯输出配合 3 bpw 输出层和 4096 token 缓存16 GB 显存即可推理 70B 模型。一条命令转换模型到 EXL3转换入口是仓库根目录的 convert.py# 基本转换 python convert.py -i HF模型目录 -o 输出目录 -w 工作目录 -b 目标比特率 # 恢复中断的量化任务 python convert.py -w 工作目录 -r几个关键参数的含义详细说明见 doc/convert.md-b目标平均比特率如3.5-hq提升注意力等关键层的比特率MoE 模型体积仅增加 0.05-0.10 bpw但精度收益显著-w工作目录需预留足够空间存放一份完整输出模型副本用于断点续传-d可指定多张 GPU 并行加速量化首次运行启动本地聊天机器人转换完成后仓库内置了命令行聊天脚本 examples/chat.py两步启动# 1. 查看支持的提示词模式 python examples/chat.py -modes # 2. 启动聊天以 Llama 3 为例 python examples/chat.py -m /path/to/llama3.1-8b-instruct-exl3 -mode llama3常用参数速查-tps每次回复后显示 tokens/秒方便观察推理速度-sp自定义系统提示词-maxr限制单次回复最大 token 数默认 5000-prompt单次提问模式适合脚本化调用模型加载逻辑统一封装在 exllamav3/model_init.py其中提供了缓存大小-cs、CPU 缓存、采样参数等标准命令行参数。进阶示例多模态图片理解除了纯文本对话ExLlamaV3 还支持视觉模型。仓库提供了图片描述示例 examples/imgdesc.py可以直接对示例图片进行理解更多可参考的示例脚本都在 examples/ 目录下包括约束生成Formatron / llguidance、投机解码、批量翻译、异步生成器等。如何评估量化模型的质量选模型时建议关注两张图困惑度Perplexity曲线和显存占用曲线。以 Llama 3.1 70B Instruct 为例EXL3 在 4 bpw 附近就能取得与更高比特率格式相近的困惑度代码能力方面EXL3 量化的模型在 HumanEval 基准上表现稳定接近原始模型水平评测脚本可参考 eval/humaneval.py 和 eval/ppl.py。常见问题与进阶资源Q支持哪些模型查看 exllamav3/architecture/ 目录每个文件对应一种模型架构如 deepseek_v3.py、qwen3.py。Q需要调优运行时行为怎么办所有运行时和构建时的环境变量开关都记录在 doc/env_vars.md 中如注意力加速路径、缓存行为等均有合理默认值。Q想在 Transformers 中使用项目提供 HF Transformers 集成插件示例见 examples/transformers_integration.py。Q量化格式原理想深入研究详细技术说明在 doc/exl3.md量化器核心代码在 exllamav3/modules/quant/exl3_lib/quantize.py。至此你已经完成了 ExLlamaV3 的安装、模型转换和首次运行 。接下来可以试试调整比特率观察速度与精度的权衡或者接入 TabbyAPI 获得 OpenAI 兼容的 API 服务体验。【免费下载链接】exllamav3An optimized quantization and inference library for running LLMs locally on modern consumer-class GPUs项目地址: https://gitcode.com/gh_mirrors/ex/exllamav3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考