️ 基础环境组件规格/版本操作系统UOS V25 服务器操作系统服务器型号浪潮 AI 服务器 (NF5468m6)AI 加速卡沐曦C500驱动版本metax-driver-3.7.2.30-rpm-x86_64.runSDK版本maca-sdk-3.7.2.0-rpm-x86_64.tar.xzDocker 版本v24.0.9 驱动和SDK安装请参考UOS V2500 沐曦驱动安装手册 容器化部署1. 拉取官方镜像dockerpull registry.uniontech.com/uos-ai/uos-server-25-metax-sglang:v0.5.92. 创建并启动容器dockerrun-d\--networkhost\--ipchost\--namesglang-api\--shm-size 100G\--ulimitmemlock-1\--ulimitnofile1024000\--device/dev/dri\--device/dev/mxcd\--device/dev/mem\--group-add video\--privileged\--security-optseccompunconfined\--security-optapparmorunconfined\-eCUDA_VISIBLE_DEVICES1\-v/data/models/:/models:ro\registry.uniontech.com/uos-ai/uos-server-25-metax-sglang:v0.5.9\sleepinfinity3. 进入容器环境dockerexec-itsglang-api /bin/bash4.启动 sglang 推理服务python-msglang.launch_server --model-path /models/DeepSeek-R1-Distill-Qwen-32B\--host0.0.0.0\--port9100\--served-model-name deepseek\--tensor-parallel-size2\--mem-fraction-static0.9\--trust-remote-code\--attention-backend flashinfer\--enable-metrics\--disable-radix-cache\--disable-chunked-prefix-cache\--disable-cuda-graph 服务启动成功截图✅ 服务验证发送测试请求curl-XPOST http://localhost:9100/v1/chat/completions\-HContent-Type: application/json\-d{ model: deepseek, messages: [{role: user, content: 你好请介绍一下自己}], temperature: 0.7, max_tokens: 200, stream: false } 预期返回 JSON 格式的模型回复