🖥️ 基础环境

组件 规格/版本
操作系统 UOS V25 服务器操作系统
服务器型号 浪潮 AI 服务器 (NF5468m6)
AI 加速卡 沐曦C500
驱动版本 metax-driver-3.7.2.30-rpm-x86_64.run
SDK版本 maca-sdk-3.7.2.0-rpm-x86_64.tar.xz
Docker 版本 v24.0.9

📦 驱动和SDK安装

请参考:UOS V2500 沐曦驱动安装手册

🐳 容器化部署

1. 拉取官方镜像

# X86架构
docker pull registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.20.0-maca.ai3.5.3.502-torch2.8-py312-x86_64

# aarch64架构
docker pull registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.11.0-aarch64

2. 创建并启动容器

# x86架构
docker run -d \
  --network host \
  --ipc=host \
  --name=vllm-openapi-test-limit \
  --shm-size 100G \
  --ulimit memlock=-1 \
  --ulimit nofile=1024000 \
  --device=/dev/dri \
  --device=/dev/mxcd \
  --device=/dev/mem \
  --group-add video \
  --security-opt seccomp=unconfined \
  --security-opt apparmor=unconfined \
  -e VLLM_USE_MXGPU=1 \
  -e MACA_SMALL_PAGESIZE_ENABLE=1 \
  -e MACA_GRAPH_LAUNCH_MODE=1 \
  -e CUDA_VISIBLE_DEVICES=1 \   #指定卡运行
  -v /data/models:/models:ro \
  registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.20.0-maca.ai3.5.3.502-torch2.8-py312-x86_64 \
  sleep infinity
  
# aarch64架构  
docker run -d \
  --network host \
  --ipc=host \
  --name=vllm-openapi \
  --shm-size 100G \
  --ulimit memlock=-1 \
  --ulimit nofile=1024000 \
  --device=/dev/dri \
  --device=/dev/mxcd \
  --device=/dev/mem \
  --group-add video \
  --security-opt seccomp=unconfined \
  --security-opt apparmor=unconfined \
  -e VLLM_USE_MXGPU=1 \
  -e MACA_SMALL_PAGESIZE_ENABLE=1 \
  -e MACA_GRAPH_LAUNCH_MODE=1 \
  -v /root/models/:/models:ro \
  registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.11.0-aarch64 \
  sleep infinity

3. 进入容器环境

docker exec -it vllm-openapi /bin/bash

4.启动 vLLM 推理服务

vllm serve /models/DeepSeek-R1-Distill-Qwen-1.5B \
	--served-model-name deepseek \
	--port 8000 \
	--tensor-parallel-size 1 \
	--dtype bfloat16 \
	--gpu-memory-utilization 0.85 \
	--trust-remote-code

📷 服务启动成功截图:
在这里插入图片描述

✅ 服务验证

发送测试请求

curl -X POST http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5",
    "messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
    "temperature": 0.7,
    "max_tokens": 200,
    "stream": false
  }'

📷 预期返回 JSON 格式的模型回复:

在这里插入图片描述

Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐