登录社区云,与社区用户共同成长
邀请您加入社区
SGLang 社区与昇腾已完成深度协同,使 SGLang 在昇腾 NPU 上无缝运行大模型推理,并推出基于 SGLang 的大 EP 集群推理方案。本文介绍昇腾平台对 Qwen、LLaMA、DeepSeek 等模型的支持,以及 PD 分离、Overlap Scheduler、TP/DP Attention、DeepEP MoE 等核心加速特性,共建 sgl-kernel-npu 生态库,并提供 D
当前,昇腾已作为SGLang原生支持的后端之一进入主仓库,随着 SGLang推理引擎的更新,DeepSeek、Qwen、GLM等模型可以在不调整模型参数、不引入额外插件的情况下直接运行,HiCache、Mooncake等系统能力也在对应版本中引入。可以说,这次SGLang AI金融π对呈现的,并非零散技术点,而是一条清晰的推理工程演进路径——从缓存与内存体系,到权重更新、强化学习效率,再到算力与模
CodeLlama-7b-Python 在昇腾 Atlas 800T上的性能测试报告测试环境:GitCode Notebook (Atlas 800T NPU)关键指标:- 单请求平均吞吐量:15.90 tokens/秒- 极限并发吞吐量 (Batch=64):646.40 tokens/秒- 平均延迟稳定性:±0.08秒- 模型加载时间:15.20秒场景性能对比图单流低延迟 (Batch=1)