️ 基础环境组件规格/版本操作系统UOS V25 服务器操作系统服务器型号浪潮 AI 服务器 (NF5468m6)AI 加速卡沐曦C500驱动版本metax-driver-3.7.2.30-rpm-x86_64.runSDK版本maca-sdk-3.7.2.0-rpm-x86_64.tar.xzDocker 版本v24.0.9 驱动和SDK安装请参考UOS V2500 沐曦驱动安装手册 容器化部署1. 拉取官方镜像# X86架构dockerpull registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.20.0-maca.ai3.5.3.502-torch2.8-py312-x86_64# aarch64架构dockerpull registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.11.0-aarch642. 创建并启动容器# x86架构dockerrun-d\--networkhost\--ipchost\--namevllm-openapi-test-limit\--shm-size 100G\--ulimitmemlock-1\--ulimitnofile1024000\--device/dev/dri\--device/dev/mxcd\--device/dev/mem\--group-add video\--security-optseccompunconfined\--security-optapparmorunconfined\-eVLLM_USE_MXGPU1\-eMACA_SMALL_PAGESIZE_ENABLE1\-eMACA_GRAPH_LAUNCH_MODE1\-eCUDA_VISIBLE_DEVICES1\#指定卡运行-v/data/models:/models:ro\registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.20.0-maca.ai3.5.3.502-torch2.8-py312-x86_64\sleepinfinity# aarch64架构dockerrun-d\--networkhost\--ipchost\--namevllm-openapi\--shm-size 100G\--ulimitmemlock-1\--ulimitnofile1024000\--device/dev/dri\--device/dev/mxcd\--device/dev/mem\--group-add video\--security-optseccompunconfined\--security-optapparmorunconfined\-eVLLM_USE_MXGPU1\-eMACA_SMALL_PAGESIZE_ENABLE1\-eMACA_GRAPH_LAUNCH_MODE1\-v/root/models/:/models:ro\registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.11.0-aarch64\sleepinfinity3. 进入容器环境dockerexec-itvllm-openapi /bin/bash4.启动 vLLM 推理服务vllm serve /models/DeepSeek-R1-Distill-Qwen-1.5B\--served-model-name deepseek\--port8000\--tensor-parallel-size1\--dtypebfloat16\--gpu-memory-utilization0.85\--trust-remote-code 服务启动成功截图✅ 服务验证发送测试请求curl-XPOST http://localhost:8000/v1/chat/completions\-HContent-Type: application/json\-d{ model: qwen3.5, messages: [{role: user, content: 你好请介绍一下自己}], temperature: 0.7, max_tokens: 200, stream: false } 预期返回 JSON 格式的模型回复