统信 UOS + 沐曦 C500 容器化部署 SGLang 推理完整实操手册
·
🖥️ 基础环境
| 组件 | 规格/版本 |
|---|---|
| 操作系统 | UOS V25 服务器操作系统 |
| 服务器型号 | 浪潮 AI 服务器 (NF5468m6) |
| AI 加速卡 | 沐曦C500 |
| 驱动版本 | metax-driver-3.7.2.30-rpm-x86_64.run |
| SDK版本 | maca-sdk-3.7.2.0-rpm-x86_64.tar.xz |
| Docker 版本 | v24.0.9 |
📦 驱动和SDK安装
🐳 容器化部署
1. 拉取官方镜像
docker pull registry.uniontech.com/uos-ai/uos-server-25-metax-sglang:v0.5.9
2. 创建并启动容器
docker run -d \
--network host \
--ipc=host \
--name=sglang-api \
--shm-size 100G \
--ulimit memlock=-1 \
--ulimit nofile=1024000 \
--device=/dev/dri \
--device=/dev/mxcd \
--device=/dev/mem \
--group-add video \
--privileged \
--security-opt seccomp=unconfined \
--security-opt apparmor=unconfined \
-e CUDA_VISIBLE_DEVICES=1 \
-v /data/models/:/models:ro \
registry.uniontech.com/uos-ai/uos-server-25-metax-sglang:v0.5.9 \
sleep infinity
3. 进入容器环境
docker exec -it sglang-api /bin/bash
4.启动 sglang 推理服务
python -m sglang.launch_server --model-path /models/DeepSeek-R1-Distill-Qwen-32B \
--host 0.0.0.0 \
--port 9100 \
--served-model-name deepseek \
--tensor-parallel-size 2 \
--mem-fraction-static 0.9 \
--trust-remote-code \
--attention-backend flashinfer \
--enable-metrics \
--disable-radix-cache \
--disable-chunked-prefix-cache \
--disable-cuda-graph
📷 服务启动成功截图:

✅ 服务验证
发送测试请求
curl -X POST http://localhost:9100/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
"temperature": 0.7,
"max_tokens": 200,
"stream": false
}'
📷 预期返回 JSON 格式的模型回复:

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构
更多推荐


所有评论(0)