统信UOS下天数智芯ix-exporter监控加速卡(非K8S)
·
🖥️ 基础环境
| 组件 | 规格/版本 |
|---|---|
| 操作系统 | UOS V25 服务器操作系统 |
| 服务器型号 | 浪潮 AI 服务器 (NF5468m6) |
| AI 加速卡 | 天数智芯 B150 |
| 驱动版本 | corex-driver-linux64-4.4.0_x86_64_10.2.run |
| Docker 版本 | v24.0.9 |
📦 驱动安装
🐳 容器化部署
1. 拉取镜像
docker pull registry.uniontech.com/uos-ai/ix-exporter:4.4.0
2. 创建并启动容器
docker run -d \
--name ix-exporter \
-p 32021:32021 \
-v /proc:/host-proc:ro \
-v /sys:/sys:ro \
-v /dev:/dev \
-v /etc/localtime:/etc/localtime:ro \
--privileged \
--user 0 \
registry.uniontech.com/uos-ai/ix-exporter:4.4.0 \
--ip=0.0.0.0 \
--port=32021
备注:直接以容器方式启动 ix-exporter 时,其暴露的 Metrics 中不包含 Kubernetes 相关的 Label 信息(如 namespace、pod、container)。如需 Kubernetes 场景下的完整 Label,请使用 K8S 部署方式。
3. 验证服务
在浏览器中访问以下地址,确认指标数据正常返回:
http://<服务器IP>:32021/metrics
成功访问后的预期输出示例:

Prometheus 配置与容器化部署
1. 编写配置文件
vLLM 监控配置(prometheus.yml)
global:
scrape_interval: 15s
evaluation_interval: 15s
scrape_timeout: 10s
scrape_configs:
- job_name: 'vllm-monitoring'
static_configs:
- targets:
- '10.10.13.111:8000' # vLLM 服务地址和端口
- job_name: 'gpu-monitoring'
static_configs:
- targets:
- '10.10.13.107:32021' # ix-exporter 默认监听端口
SGLang 监控配置(prometheus.yml)
global:
scrape_interval: 15s
evaluation_interval: 15s
scrape_timeout: 10s
scrape_configs:
- job_name: 'sglang-monitoring'
static_configs:
- targets:
- '10.10.75.30:30000' # SGLang 服务地址和端口
- job_name: 'gpu-monitoring'
static_configs:
- targets:
- '10.10.13.107:32021' # ix-exporter 默认监听端口
2. 部署 Prometheus(容器化)
创建必要目录和文件
mkdir -p /data/prometheus/data
touch /data/prometheus/prometheus.yml
chmod -R 777 /data/prometheus
启动 Prometheus 容器
docker run -d \
--name prometheus \
-p 9090:9090 \
-v /data/prometheus/data:/prometheus \
-v /data/prometheus/prometheus.yml:/etc/prometheus/prometheus.yml \
registry.uniontech.com/uos-ai/uos-server-20-prometheus:2.32.1
服务启动后,访问地址为:http://<服务器IP>:9090,可在 Status > Targets 中查看指标采集状态。
Grafana 配置与仪表盘导入
容器化部署 Grafana
使用以下命令快速启动 Grafana 服务(默认端口 3000,首次登录账号密码为 admin/admin):
docker run -d \
--name grafana \
-p 3000:3000 \
registry.uniontech.com/uos-ai/grafana:v13.0.1
创建数据源
- 登录 Grafana,进入 Connections > Data Sources;
- 选择 Prometheus,输入 Prometheus 访问地址
http://<服务器IP>:9090; - 点击 Save & Test 保存配置并验证连接是否可用。
导入定制仪表盘
导入 GPU 监控仪表盘(基于 ix-exporter)
- 登录 Grafana,点击左侧 Dashboards > Import;
- 上传仪表盘 JSON 文件(
iluvatar-bi-v150-dashboard.json); - 选择已创建的 Prometheus 数据源,点击 Import 完成导入。
导入 vLLM 监控仪表盘
vLLM 相关监控可使用 vllm-dashboard.json 文件,导入步骤同上。
导入 SGLang 监控仪表盘
SGLang 相关监控可使用 sglang-dashboard.json 文件,导入步骤同上。
附件
iluvatar-bi-v150-dashboard.json
sglang-dashboard.json
vllm-dashboard.json
openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构
更多推荐
所有评论(0)