️ 基础环境组件规格/版本操作系统UOS V25 服务器操作系统服务器型号浪潮 AI 服务器 (NF5468m6)AI 加速卡沐曦C500驱动版本metax-driver-3.7.2.30-rpm-x86_64.runSDK版本maca-sdk-3.7.2.0-rpm-x86_64.tar.xzDocker 版本v24.0.9 驱动和SDK安装请参考UOS V2500 沐曦驱动安装手册下载安装包官方下载中心沐曦资源中心驱动包名称mx-exporter.0.15.2.tgzexport安装部署1.安装部署# 安装MXMACA SDK之后在 /opt/maca/wheel 目录下找到Python 3 的wheel包**mx_exporter_*.whl**。# 进入到目录cd/opt/maca/wheel# 安装whlpipinstallmx_exporter-2.2.6-py3-none-any.whl2.使用方法mx-exporter 参数说明wheel包安装参数描述-p PORT, --port PORT主机需要开放的HTTP端口号。若不指定默认为8000-i INTERVAL,--interval INTERVALmx-exporter持续收集指标的间隔时间单位ms。若不指定默认为10000ms-c CONFIG_FILE,--config-file CONFIG_FILE若不指定默认配置文件为/opt/maca/etc/default-counters.csv若自定义配置文件需基于默认配置文件参考 3.2 修改配置文件-h, --help显示帮助信息执行以下命令启动mx-exporter监听端口为8002收集指标间隔为5ssudomx-exporter-p8002-i50003. 查看mx-exporter抓取数据在浏览器输入http://host_ip:host_port/metrics或执行curl http://host_ip:host_port/metrics其中host_port是主机需要开放的HTTP端口号可用-p指定。例如http://10.10.13.111:8002/metricsPrometheus 配置与容器化部署1. 配置文件编写prometheus.ymlprometheus监控vLLM服务配置文件# 全局配置项适用于所有 jobglobal:# 设置 Prometheus 抓取目标指标的时间间隔scrape_interval:15s# 每 15 秒抓取一次数据默认是 1 分钟# 设置评估告警规则的时间间隔evaluation_interval:15s# 每 15 秒检查一次告警规则默认是 1 分钟# 设置每次抓取目标的最大超时时间scrape_timeout:10s# 默认也是 10 秒# 抓取目标配置scrape_configs:# 第一个 job监控 vllm 推理服务-job_name:vllm-monitoring# job 名称static_configs:-targets:-10.10.13.111:8000# vllm 服务的地址和端口# 第二个 jobGPU 监控使用 nvitop-exporter-job_name:gpu-monitoring# job 名称用于标识 GPU 指标来源static_configs:-targets:-10.10.13.111:8002# mx-exporter 默认监听在 8002 端口prometheus监控SGLang服务配置文件# 全局配置项适用于所有 jobglobal:# 设置 Prometheus 抓取目标指标的时间间隔scrape_interval:15s# 每 15 秒抓取一次数据默认是 1 分钟# 设置评估告警规则的时间间隔evaluation_interval:15s# 每 15 秒检查一次告警规则默认是 1 分钟# 设置每次抓取目标的最大超时时间scrape_timeout:10s# 默认也是 10 秒# 抓取目标配置scrape_configs:# 第一个 job监控 vllm 推理服务-job_name:sglang-monitoring# job 名称static_configs:-targets:-10.10.75.30:30000# sglang 服务的地址和端口# 第二个 jobGPU 监控使用 nvitop-exporter-job_name:gpu-monitoring# job 名称用于标识 GPU 指标来源static_configs:-targets:-10.10.13.111:8002# mx-exporter 默认监听在 5050 端口容器化部署使用 镜像部署 Prometheus挂载配置文件与数据存储目录确保服务重启后数据不丢失# 创建prometheus文件夹mkdir/root/xyh/prometheus# 在prometheus文件夹创建prometheus.yml文件cd/root/xyh/prometheustouchprometheus.yml# 创建数据目录mkdirdata# 为Prometheus文件夹分配权限chmod-R777/root/xyh/prometheus# 启动容器prometheus服务dockerrun-d--nameprometheus\-p9090:9090\-v/data/prometheus/data:/prometheus\-v/data/prometheus/prometheus.yml:/etc/prometheus/prometheus.yml\registry.uniontech.com/uos-app/uos-server-20-prometheus:2.32.1访问地址http://服务器IP:9090可在Status Targets中查看指标采集状态。Grafana 配置与仪表盘导入容器化部署使用镜像快速启动 Grafana 服务默认端口为 3000首次登录默认账号密码为admin/admindockerrun-d--namegrafana-p3000:3000 registry.uniontech.com/uos-ai/grafana:v13.0.1创建数据源登录 Grafana进入connection Data Sources选择prometheus输入prometheus访问地址http://ip地址:9090点击save test 保存配置并测试prometheus API是否可用。导入 nvitop 定制仪表盘可以直接使用上传的 metax-mxc500-physical.json 文件。导入步骤登录 Grafana选择 Prometheus 作为数据源完成仪表盘加载。选择本地metax-mxc500-physical.json 文件导入同理对于 vLLM 相关的监控可使用 vllm-dashboard.json 文件导入方式同上。同理对于 SGLang 相关的监控可使用 sglang-dashboard.json 文件导入方式同上。