尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

vLLM requirements 15个文件速查:部署前3分钟选对安装文件

vLLM requirements 15个文件速查:部署前3分钟选对安装文件 vLLM requirements 15个文件速查部署前3分钟选对安装文件【免费下载链接】vllmA high-throughput and memory-efficient inference and serving engine for LLMs项目地址: https://gitcode.com/GitHub_Trending/vl/vllm部署 vLLM 时最容易踩的第一坑是 requirements.txt 文件选择requirements/ 目录下每种硬件各有一个 .txt选错了要么装不上要么装完跑不快。下面按硬件、继承机制、版本锁定、报错修复四步把整套 vLLM requirements 文件讲清楚。硬件对应 requirements 文件NVIDIA、AMD、Intel、TPU、CPU 各一个先看你手上的卡是哪种直接对号入座。五个硬件文件都能单独装装哪条命令就用哪条你的硬件requirements 文件安装命令说明NVIDIA GPUcuda.txtpip install -r requirements/cuda.txt生产主力含 flashinfer 等 CUDA 算子AMD GPUrocm.txtpip install -r requirements/rocm.txtROCm 平台含 conch-triton-kernelsIntel GPUxpu.txtpip install -r requirements/xpu.txt走 XPU 专用 wheel 源Google TPUtpu.txtpip install -r requirements/tpu.txt云端 TPU依赖 ray 调度纯 CPUcpu.txtpip install -r requirements/cpu.txt调试、低资源场景判断逻辑只有一条先看卡再选文件。混合部署比如同时有 A100 和 MI300 的机器群就分别装别混在一个环境里。common.txt 打底-r 继承链怎么工作15 个文件其实分三堆公共包common.txt所有环境共享的几十个依赖、硬件包上面五个每个只写自己硬件的差异、加餐包test、dev、docs、kv_connectors 这类按需装的。硬件包的开头都是同一行以 cuda.txt 为例-r common.txt torch2.13.0-r的意思是先把 common.txt 整个展开安装再装本文件剩下的部分。所以硬件包永远很薄因为公共部分不用重复写。dev.txt 甚至整个文件只有两条-rlint.txt 和 test/cuda.txt等于把代码检查加测试依赖打包带走。文件里还常见条件依赖分号后面是生效条件xgrammar 0.2.1, 1.0.0; platform_machine x86_64 or platform_machine aarch64 torch2.13.0cpu; platform_machine x86_64 or platform_machine s390x第一条表示 xgrammar 只在列出架构的机器上装别的架构跳过第二条表示 cpu.txt 里的 cpu 版 torch 只在 x86_64、s390x 这类平台生效macOSplatform_system Darwin走的是普通版 torch。你换平台不用手动改文件pip 会自动挑对应那行。版本锁定规则 和 两种写法xformers 绑定要注意两种写法混着用分工不同严格锁cuda.txt 里 torch2.13.0、torchaudio2.11.0、torchvision0.28.0 是三个一起锁死的文件里注释写得很直白——这几项必须跟着 torch 同步升。单独把 torch 升上去vision/audio 就会对不上。最低版本transformers 5.10.4、tokenizers 0.21.1 只卡下限允许你装更高的小版本这是给生态留的余地。xformers 的强绑定当前 cuda.txt 已经用 flashinfer 这一套替代了 xformers但老版本的 vLLM 里 xformers 与特定 PyTorch 版本一一对应只升其中一边就跑不通。看到旧教程让你单独改 xformers 或 torch 时停手整套文件一起升。ray 的位置cuda.txt 里没有 ray需要分布式调度的 tpu.txt 锁了 ray[default] 和 ray[data]xpu.txt 要求 ray2.9。装 TPU 或 XPU 环境时别漏掉这条。CPU 和 ROCm 环境差别CPU 版砍掉了什么ROCm 版加了什么两个非 NVIDIA 环境差别方向相反cpu.txt 相对 cuda.txt砍掉 flashinfer、flashinfer-cubin 等一整套 CUDA 算子CPU 上没有它们的位置加回 torch2.13.0cpux86_64 / s390x / aarch64 三平台x86_64 额外装 intel-openmp 做 CPU 加速aarch64 额外装 py-cpuinfo用来识别 ARM Neoverse 核心做调度优化s390x 平台 numba 被禁用torchaudio、torchvision 也在该平台跳过rocm.txt 相对 cuda.txt加 conch-triton-kernels1.2.1 作为算子补充加 amd-quark0.12.post1 支持 Quark 量化加 datasets、peft、runai-model-streamergrpcio 和 grpcio-reflection 锁在同一个 1.78.0防止两边版本错开同样没有 flashinfer 系依赖tilelang 版本也和 cuda.txt 不同0.1.10 对 0.1.12一句话记忆CUDA 版管快CPU 版管能跑ROCm 版管 AMD 专属算子。装不上依赖冲突、CUDA 不匹配、xformers 三个高频报错的修复CUDA 版本不匹配症状启动时报 libcudart.so 找不到或 torch 的 CUDA 版本和驱动对不上。python -c import torch; print(torch.version.cuda) pip install --force-reinstall -r requirements/cuda.txt先打出 torch 实际带的 CUDA 版本和机器驱动比一下对不上就别单补包整条 cuda.txt 重装让所有锁定的包回到同一套组合。xformers 找不到 wheel症状ERROR: Could not find a version that satisfies the requirement xformers。uname -mxformers 只对有限的平台 PyTorch 版本组合提供预编译 wheel报错基本是组合没对上。确认架构是 x86_64 之后仍然装不上说明这个版本组合本身没有 wheel正确做法是跟着 requirements 目录里的文件整套升级而不是加 --no-deps 硬装——那样装完是运行时炸不是安装时报错。依赖冲突症状Cannot install vllm because these package versions have conflicting dependencies。python -m venv vllm-env source vllm-env/bin/activate pip install -r requirements/cuda.txt冲突多半来自环境里旧包残留。先开干净虚拟环境再整文件安装仍有冲突就跑pip check定位到具体包单独升级或移除别把两个不同硬件的 .txt 装进同一个环境。开发者与专项文件一览test、dev、lint、kv_connectors 分别管什么test/ 目录按平台分了 cuda.txt、rocm.txt、xpu.txt、cpu.txt 四份测试依赖另有 nightly-torch.txt 用于验证最新 PyTorch 的兼容性主要服务 CIdev.txt 只有两行-r等于 lint.txt test/cuda.txt本地开发装这一个就够lint.txt 就一条 pre-commit管代码风格和格式docs.txt 是文档构建工具链配合 docs/ 出文档用普通用户不用装kv_connectors.txt 装 lmcache、nixl、mooncake-transfer-engine 等 KV 缓存传输组件做分布式 KV 缓存时按需加装选文件的判断逻辑一句话硬件定五个文件里装哪个公共部分都由 common.txt 兜底开发和专项需求再叠 test、dev、kv_connectors。版本随迭代常变每次升级 vLLM 前回看一眼 requirements/ 的改动能省掉大部分排查时间。【免费下载链接】vllmA high-throughput and memory-efficient inference and serving engine for LLMs项目地址: https://gitcode.com/GitHub_Trending/vl/vllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表