基础环境

组件 规格/版本
操作系统 UOS V25 服务器操作系统
服务器型号 鲲鹏920
AI 加速卡 沐曦C500
Docker 版本 v24.0.9

驱动安装

请参考:UOS V2500 沐曦驱动安装手册

部署步骤

在两个节点分别启动vllm容器

# 拉取容器镜像
# x86架构镜像
docker pull registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.20.0-maca.ai3.5.3.502-torch2.8-py312-x86_64
# AArch64架构镜像
docker pull registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.11.0-aarch64

# AArch64架构
docker run -d \
  --privileged \
  --network host \
  --ipc=host \
  --name=vllm-openapi \
  --shm-size 100G \
  --ulimit memlock=-1 \
  --ulimit nofile=65535:65535 \
  --device=/dev/dri \
  --device=/dev/mxcd \
  --device=/dev/mem \
  --group-add video \
  --security-opt seccomp=unconfined \
  --security-opt apparmor=unconfined \
  -e RAY_EXPERIMENTAL_NOSET_CUDA_VISIBLE_DEVICES=1 \
  -e NCCL_SOCKET_IFNAME=enp23s0f0 \  #指定网卡
  -e GLOO_SOCKET_IFNAME=enp23s0f0 \  #指定网卡
  -e VLLM_USE_MXGPU=1 \
  -e MACA_SMALL_PAGESIZE_ENABLE=1 \
  -e MACA_GRAPH_LAUNCH_MODE=1 \
  -v /home/models/:/models:ro \
  registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.11.0-aarch64 \
  sleep infinity

部署ray集群

# 进入容器服务
docker exec -it vllm-openapi /bin/bash

# 在主节点先停止ray服务
ray stop

# 在主节点上启动 Ray 头节点,指定端口  num-gpus 根据环境实际信息修改
ray start  --head --port=6379 --num-gpus=1  --node-ip-address 10.10.18.25

# 在子节点停止ray服务
ray stop 

# 在子节点启动ray服务并加入集群
ray start --address=10.10.18.25:6379 --node-ip-address 10.10.18.21 --num-gpus=1
 

# 查看集群信息
ray status

大模型测试

部署vllm服务

# 在head节点启动vllm服务
 vllm serve /models/DeepSeek-R1-Distill-Qwen-32B \
  --trust-remote-code \
  --tensor-parallel-size 2 \
  --max-num-seqs 64 \
  --enable-chunked-prefill \
  --host 0.0.0.0 \
  --gpu-memory-utilization 0.8 \
  --served-model-name deepseek \
  --distributed-executor-backend ray \
  --enforce-eager

📷 服务启动成功截图:

![[UOS V2500 沐曦C500 AI加速卡部署vllm服务手册-20260609.png]]

✅ 服务验证

发送测试请求

curl -X POST http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5",
    "messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
    "temperature": 0.7,
    "max_tokens": 200,
    "stream": false
  }'

📷 预期返回 JSON 格式的模型回复:

在这里插入图片描述

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐