🖥️ 基础环境

组件 规格/版本
操作系统 UOS V25 服务器操作系统
服务器型号 浪潮 AI 服务器 (NF5468m6)
AI 加速卡 沐曦C500
驱动版本 metax-driver-3.7.2.30-rpm-x86_64.run
SDK版本 maca-sdk-3.7.2.0-rpm-x86_64.tar.xz
Docker 版本 v24.0.9

📦 驱动和SDK安装

请参考:UOS V2500 沐曦驱动安装手册

🐳 容器化部署

1. 拉取官方镜像

docker pull registry.uniontech.com/uos-ai/uos-server-25-metax-sglang:v0.5.9

2. 创建并启动容器

docker run -d \
  --network host \
  --ipc=host \
  --name=sglang-api \
  --shm-size 100G \
  --ulimit memlock=-1 \
  --ulimit nofile=1024000 \
  --device=/dev/dri \
  --device=/dev/mxcd \
  --device=/dev/mem \
  --group-add video \
  --privileged \
  --security-opt seccomp=unconfined \
  --security-opt apparmor=unconfined \
  -e CUDA_VISIBLE_DEVICES=1 \
  -v /data/models/:/models:ro \
  registry.uniontech.com/uos-ai/uos-server-25-metax-sglang:v0.5.9 \
  sleep infinity

3. 进入容器环境

docker exec -it sglang-api /bin/bash

4.启动 sglang 推理服务

python -m sglang.launch_server --model-path /models/DeepSeek-R1-Distill-Qwen-32B \
--host 0.0.0.0 \
--port 9100 \
--served-model-name deepseek \
--tensor-parallel-size 2 \
--mem-fraction-static 0.9 \
--trust-remote-code \
--attention-backend flashinfer \
--enable-metrics \
--disable-radix-cache \
--disable-chunked-prefix-cache \
--disable-cuda-graph

📷 服务启动成功截图:

✅ 服务验证

发送测试请求

curl -X POST http://localhost:9100/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek",
    "messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
    "temperature": 0.7,
    "max_tokens": 200,
    "stream": false
  }'

📷 预期返回 JSON 格式的模型回复:

Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐