尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

vLLM :安装及部署大模型详解

vLLM :安装及部署大模型详解 vLLM 是一个快速且易于使用的 LLM 推理库支持多种模型和硬件加速。中文官网地址vllm快车道1. 系统要求1.1硬件要求GPU: NVIDIA GPU (推荐 16GB 显存)CUDA: 支持 CUDA 11.8 或 12.1内存: 至少 16GB RAM1.2软件要求Python 3.8-3.11Linux2. 安装方法2.1方法一使用 pip 安装推荐# 创建虚拟环境可选但推荐 conda create --name vllm python3.10 conda activate vllm # 安装 vLLM pip install vllmpython环境搭建可参考 基本环境搭建教程2.2方法二从源码编译安装# 克隆仓库 git clone https://github.com/vllm-project/vllm.git cd vllm # 安装依赖 pip install -e .3.部署大模型python -m vllm.entrypoints.openai.api_server \ --model your_model_path \ --dtype half \ --trust-remote-code \ --tensor-parallel-size 1 \ --max-model-len 5120 \ --enforce-eager \ --gpu-memory-utilization 0.95 \ --max-num-batched-tokens 5120 \ --max-num-seqs 5 \ --host 0.0.0.0 \ --served-model-name DeepSeek-R1-7B \ --port 8080 部署的模型需要先下载到本地your_model_path 这里需替换成自己的模型路径下载模型可从huggingface或者modelscope官网下载huggingface还有国内镜像网站。如果顺利的话这样就已经把本地大模型部署成 OpenAI API 服务就可以使用了连接使用了。4.常见问题4.1 vllm依赖缺失推荐安装# 使用python3.10 conda create --name vllm python3.10 # 安装vllm相关依赖 pip install torch2.3.0 torchvision0.18.0 torchaudio2.3.0 --index-url https://download.pytorch.org/whl/cu121 # 使用指定的版本 pip install vllm0.43pytorch的安装可参考pytorch官网。部分依赖安装可能需要指定版本才能适配按照报错的提示安装指定版本即可。4.2 CUDA问题1nvidia驱动地址安装驱动nvidia驱动地址 选取x86_64 历史版本中的530.30.02版本,此版本对应cuda12.12Cuda安装安装完cuda驱动后再进行 cuda安装。3修改cuda环境变量# 第一步 vim ~/.bashrc # 第二步在最下面插入并保存,/usr/local/cuda-xx.x,/usr/local/cuda-xx.x/libxx export PATH/usr/local/cuda-xx.x/bin:$PATH export LD_LIBRARY_PATH/usr/local/cuda-xx.x/libxx:$LD_LIBRARY_PATH # 第三步:刷新环境变量 source ~/.bashrc # 第四步:验证cuda nvcc -V4检查 cuda 、driver 是否一致nvcc -V Nvidia-smi4.3 模型配置到Harness中无法掉工具vllm部署时加上这2个参数即可--enable-auto-tool-choice --tool-call-parser hermes
返回列表