华为昇腾Atlas 300I A2 推理卡-910B芯片大模型部署
一、驱动安装
1)创建用户
groupadd HwHiAiUser
useradd -g HwHiAiUser -d /home/HwHiAiUser -m HwHiAiUser -s /bin/bash
2)获取显卡对应的驱动(910B)

3)安装NPU驱动
chmod +x Ascend-hdk-910b-npu-driver_25.5.2_linux-aarch64.run
./Ascend-hdk-910b-npu-driver_25.5.2_linux-aarch64.run --full --install-for-all
(1)安装NPU固件
chmod +x Ascend-hdk-910b-npu-firmware_*.run
./Ascend-hdk-910b-npu-firmware_*.run --full

(2)安装CANN
|
软件包名称 |
说明 |
|
Ascend-cann-toolkit_9.0.0_linux-aarch64.run |
开发套件,包含推理/训练工具链、AI框架适配、ATC模型转换工具等 |
|
Ascend-cann-910b-ops_9.0.0_linux-aarch64.run |
面向 Atlas A2 系列 的算子包,910B4 属于 A2 系列,必须安装此包 |
|
Ascend-cann-nnal_9.0.0_linux-aarch64.run |
加速库(如深度神经网络库),建议安装,可提升运行时性能 |
|
Ascend-docker-runtime_7.1.RC1_linux-aarch64.run |
昇腾显卡的运行时环境 |
(3)安装Ascend-cann-toolkit
chmod +x Ascend-cann-toolkit_9.0.0_linux-aarch64.run
./Ascend-cann-toolkit_9.0.0_linux-aarch64.run --install --install-path=/usr/local/Ascend
echo "source /usr/local/Ascend/cann/set_env.sh" >> ~/.bashrc
source ~/.bashrc
(4)安装 Ascend-cann-ops
chmod +x Ascend-cann-910b-ops_9.0.0_linux-aarch64.run
./Ascend-cann-910b-ops_9.0.0_linux-aarch64.run --install --install-path=/usr/local/Ascend
更新环境变量
source ~/.bashrc
(3)安装Ascend-cann-nnal
chmod +x Ascend-cann-nnal_9.0.0_linux-aarch64.run
./Ascend-cann-nnal_9.0.0_linux-aarch64.run --install --install-path=/usr/local/Ascend/nnal --install-for-all --quiet --nox11
添加环境变量
echo 'source /usr/local/Ascend/nnal/nnal/atb/set_env.sh' >> ~/.bashrc
source ~/.bashrc
(5)安装Ascend-docker-runtime
chmod +x Ascend-docker-runtime_7.1.RC1_linux-aarch64.run
./Ascend-docker-runtime_7.1.RC1_linux-aarch64.run --install
systemctl daemon-reload && systemctl restart docker
二、大模型启动
1)启动容器
docker run \
--name vllm-qwen35 \
--net=host \
--shm-size=8g \
--pids-limit -1 \
--cap-add=SYS_ADMIN \
--cap-add=IPC_LOCK \
--cap-add=SYS_RESOURCE \
--security-opt seccomp=unconfined \
--restart unless-stopped \
--device /dev/davinci6 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /app/models:/app/models \
-e CUDA_VISIBLE_DEVICES=1 \
-e ASCEND_RT_VISIBLE_DEVICES=1 \
-itd \
m.daocloud.io/quay.io/ascend/vllm-ascend:v0.19.1rc1-openeuler \
/bin/bash
2)进入容器,启动模型
vllm serve /app/models/Qwen3.5-35B-A3B-w8a8-mtp \
--host 0.0.0.0 \
--port 10080 \
--served-model-name "qwen3.5" \
--default-chat-template-kwargs '{"enable_thinking": false}' \
--tensor-parallel-size 1 \
--data-parallel-size 1 \
--quantization ascend \
--max-num-seqs 128 \
--max-model-len 16384 \
--max-num-batched-tokens 16384 \
--gpu-memory-utilization 0.85 \
--trust-remote-code \
--enable-prefix-caching \
--block-size 128 \
--async-scheduling \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"enable_cpu_binding": true, "use_triton_moe": true, "multistream_overlap_shared_expert": true}' \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder

3)测试模型
curl http://localhost:10080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5",
"messages": [
{"role": "system", "content": "你是一个有帮助的AI助手"},
{"role": "user", "content": "请介绍一下你自己"},
{"role": "assistant", "content": "我是Qwen3.5,一个AI语言模型"},
{"role": "user", "content": "你能做什么?"}
],
"max_tokens": 10000,
"temperature": 0.7
}'
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐

所有评论(0)