统信UOS+沐曦C500 基于Ray集群多节点vLLM部署方案
·
基础环境
| 组件 | 规格/版本 |
|---|---|
| 操作系统 | UOS V25 服务器操作系统 |
| 服务器型号 | 鲲鹏920 |
| AI 加速卡 | 沐曦C500 |
| Docker 版本 | v24.0.9 |
驱动安装
部署步骤
在两个节点分别启动vllm容器
# 拉取容器镜像
# x86架构镜像
docker pull registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.20.0-maca.ai3.5.3.502-torch2.8-py312-x86_64
# AArch64架构镜像
docker pull registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.11.0-aarch64
# AArch64架构
docker run -d \
--privileged \
--network host \
--ipc=host \
--name=vllm-openapi \
--shm-size 100G \
--ulimit memlock=-1 \
--ulimit nofile=65535:65535 \
--device=/dev/dri \
--device=/dev/mxcd \
--device=/dev/mem \
--group-add video \
--security-opt seccomp=unconfined \
--security-opt apparmor=unconfined \
-e RAY_EXPERIMENTAL_NOSET_CUDA_VISIBLE_DEVICES=1 \
-e NCCL_SOCKET_IFNAME=enp23s0f0 \ #指定网卡
-e GLOO_SOCKET_IFNAME=enp23s0f0 \ #指定网卡
-e VLLM_USE_MXGPU=1 \
-e MACA_SMALL_PAGESIZE_ENABLE=1 \
-e MACA_GRAPH_LAUNCH_MODE=1 \
-v /home/models/:/models:ro \
registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.11.0-aarch64 \
sleep infinity
部署ray集群
# 进入容器服务
docker exec -it vllm-openapi /bin/bash
# 在主节点先停止ray服务
ray stop
# 在主节点上启动 Ray 头节点,指定端口 num-gpus 根据环境实际信息修改
ray start --head --port=6379 --num-gpus=1 --node-ip-address 10.10.18.25
# 在子节点停止ray服务
ray stop
# 在子节点启动ray服务并加入集群
ray start --address=10.10.18.25:6379 --node-ip-address 10.10.18.21 --num-gpus=1
# 查看集群信息
ray status
大模型测试
部署vllm服务
# 在head节点启动vllm服务
vllm serve /models/DeepSeek-R1-Distill-Qwen-32B \
--trust-remote-code \
--tensor-parallel-size 2 \
--max-num-seqs 64 \
--enable-chunked-prefill \
--host 0.0.0.0 \
--gpu-memory-utilization 0.8 \
--served-model-name deepseek \
--distributed-executor-backend ray \
--enforce-eager
📷 服务启动成功截图:
![![[UOS V2500 沐曦C500 AI加速卡部署vllm服务手册-20260609.png]]](https://i-blog.csdnimg.cn/direct/11b6a5c56cfd420da269dfdebe1b60e9.png)
✅ 服务验证
发送测试请求
curl -X POST http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
"temperature": 0.7,
"max_tokens": 200,
"stream": false
}'
📷 预期返回 JSON 格式的模型回复:

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐
所有评论(0)