🖥️ 基础环境

组件 规格/版本
操作系统 UOS V25 服务器操作系统
服务器型号 浪潮 AI 服务器 (NF5468m6)
AI 加速卡 天数智芯 B150
驱动版本 corex-driver-linux64-4.4.0_x86_64_10.2.run
Docker 版本 v24.0.9

📦 驱动安装

请参考:统信 UOS 天数智芯驱动安装手册

🐳 容器化部署

1. 拉取镜像

docker pull registry.uniontech.com/uos-ai/ix-exporter:4.4.0

2. 创建并启动容器

docker run -d \
  --name ix-exporter \
  -p 32021:32021 \
  -v /proc:/host-proc:ro \
  -v /sys:/sys:ro \
  -v /dev:/dev \
  -v /etc/localtime:/etc/localtime:ro \
  --privileged \
  --user 0 \
  registry.uniontech.com/uos-ai/ix-exporter:4.4.0 \
  --ip=0.0.0.0 \
  --port=32021

备注:直接以容器方式启动 ix-exporter 时,其暴露的 Metrics 中不包含 Kubernetes 相关的 Label 信息(如 namespace、pod、container)。如需 Kubernetes 场景下的完整 Label,请使用 K8S 部署方式。

3. 验证服务

在浏览器中访问以下地址,确认指标数据正常返回:

http://<服务器IP>:32021/metrics

成功访问后的预期输出示例:

Prometheus 配置与容器化部署

1. 编写配置文件

vLLM 监控配置(prometheus.yml)
global:
  scrape_interval: 15s
  evaluation_interval: 15s
  scrape_timeout: 10s

scrape_configs:
  - job_name: 'vllm-monitoring'
    static_configs:
      - targets:
          - '10.10.13.111:8000'   # vLLM 服务地址和端口

  - job_name: 'gpu-monitoring'
    static_configs:
      - targets:
          - '10.10.13.107:32021'   # ix-exporter 默认监听端口
SGLang 监控配置(prometheus.yml)
global:
  scrape_interval: 15s
  evaluation_interval: 15s
  scrape_timeout: 10s

scrape_configs:
  - job_name: 'sglang-monitoring'
    static_configs:
      - targets:
          - '10.10.75.30:30000'    # SGLang 服务地址和端口

  - job_name: 'gpu-monitoring'
    static_configs:
      - targets:
          - '10.10.13.107:32021'   # ix-exporter 默认监听端口

2. 部署 Prometheus(容器化)

创建必要目录和文件
mkdir -p /data/prometheus/data
touch /data/prometheus/prometheus.yml
chmod -R 777 /data/prometheus
启动 Prometheus 容器
docker run -d \
  --name prometheus \
  -p 9090:9090 \
  -v /data/prometheus/data:/prometheus \
  -v /data/prometheus/prometheus.yml:/etc/prometheus/prometheus.yml \
  registry.uniontech.com/uos-ai/uos-server-20-prometheus:2.32.1

服务启动后,访问地址为:http://<服务器IP>:9090,可在 Status > Targets 中查看指标采集状态。

Grafana 配置与仪表盘导入

容器化部署 Grafana

使用以下命令快速启动 Grafana 服务(默认端口 3000,首次登录账号密码为 admin/admin):

docker run -d \
  --name grafana \
  -p 3000:3000 \
  registry.uniontech.com/uos-ai/grafana:v13.0.1

创建数据源

  1. 登录 Grafana,进入 Connections > Data Sources
  2. 选择 Prometheus,输入 Prometheus 访问地址 http://<服务器IP>:9090
  3. 点击 Save & Test 保存配置并验证连接是否可用。

导入定制仪表盘

导入 GPU 监控仪表盘(基于 ix-exporter)
  1. 登录 Grafana,点击左侧 Dashboards > Import
  2. 上传仪表盘 JSON 文件(iluvatar-bi-v150-dashboard.json);
  3. 选择已创建的 Prometheus 数据源,点击 Import 完成导入。
导入 vLLM 监控仪表盘

vLLM 相关监控可使用 vllm-dashboard.json 文件,导入步骤同上。

导入 SGLang 监控仪表盘

SGLang 相关监控可使用 sglang-dashboard.json 文件,导入步骤同上。

附件

iluvatar-bi-v150-dashboard.json
sglang-dashboard.json
vllm-dashboard.json

Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐