📋 目录

🖥️ 基础环境

组件 规格/版本
操作系统 UOS V25 服务器操作系统
服务器型号 浪潮 AI 服务器 (NF5468m6)
AI 加速卡 天数智芯 B150
驱动版本 corex-driver-linux64-4.4.0_x86_64_10.2.run
Docker 版本 v24.0.9

📦 驱动安装

请参考:统信 UOS 天数智芯驱动安装手册

🐳 容器化部署

1. 拉取官方镜像

docker pull registry.uniontech.com/uos-ai/uos-server-25-iluvatar:4.4.0

2. 创建并启动容器

docker run -dit \
  -v /usr/src:/usr/src \
  -v /lib/modules:/lib/modules \
  -v /dev:/dev \
  -v /data:/data \
  --network=host \
  --name=sglang \
  --ipc=host \
  --privileged \
  registry.uniontech.com/uos-ai/uos-server-25-iluvatar:4.4.0 \
  tail -f /dev/null

3. 进入容器环境

docker exec -it sglang /bin/bash

4. 启动 SGLang 推理服务

export SGLANG_KV_CACHE_FORMAT=NHD
python3 -m sglang.launch_server \
  --model-path /data/models/DeepSeek-R1-Distill-Qwen-1.5B \
  --host 0.0.0.0 \
  --port 30000 \
  --tp 2 \
  --chunked-prefill-size 2048 \
  --attention-backend triton \
  --page-size 16 \
  --served-model-name deepseek \
  --mem-fraction-static 0.85 \
  --trust-remote-code \
  --disable-custom-all-reduce \
  --disable-cuda-graph \
  --disable-radix-cache \
  --enable-metrics

📷 服务启动成功截图:

✅ 服务验证

发送测试请求

curl -X POST http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek",
    "messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
    "temperature": 0.7,
    "max_tokens": 200,
    "stream": false
  }'

📷 预期返回: JSON 格式的模型回复,示例如下:

⚠️ 注意事项

  1. 模型路径:确保 /data/models/DeepSeek-R1-Distill-Qwen-1.5B 目录已下载完整模型权重,若未下载可使用 huggingface-cli downloadmodelscope 下载。
  2. 显存预留--mem-fraction-static 建议设为 0.85~0.90,过高易触发 OOM。
Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐