发布日期:2026-09-30

DeepSeek 于 2026 年 9 月 30 日上午通过官方公众号宣布,正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库、分布式通信库,所有组件都与此前面向英伟达平台的开源组件一一对应。本次开源共涉及 TileLang、DeepGEMM-Ascend、DeepEP-Ascend、TileKernels、FlashMLA、DeepSelect 六个 GitHub 项目,覆盖从底层编程语言到矩阵计算、专家并行通信、TopK 算子的完整链路,且官方特别提到华为团队在昇腾平台适配过程中给予了大力支持,双方已共同推进基于昇腾 950 的 128 卡超节点方案。本文逐一梳理这六个项目各自解决什么问题、核心性能数据,以及开发者如何快速上手。


这次开源了什么:6 个项目,对应英伟达平台的完整技术栈

DeepSeek 官方强调,本次昇腾开源组件与此前面向英伟达 CUDA 平台的开源项目严格一一对应,开发者如果熟悉 DeepSeek 在 NVIDIA 平台上的开源生态,可以直接按同名概念理解昇腾版本:

项目定位对应英伟达版本
TileLang领域专用语言,简化 GPU/NPU 高性能算子开发原生跨平台,本次新增昇腾后端
DeepGEMM-Ascend矩阵乘法(GEMM)核心库DeepGEMM
DeepEP-Ascend专家并行(EP)通信库DeepEP
TileKernels基于 TileLang 的算子库合集TileKernels(原生跨平台,新增昇腾支持)
FlashMLA多头潜在注意力(MLA)高效算子FlashMLA(原生跨平台)
DeepSelect稀疏注意力 TopK 算子DeepSelect(原生跨平台,新增昇腾支持)

需要说明的是,其中 TileLang、TileKernels、FlashMLA、DeepSelect 本身是跨平台项目,这次更新的是新增了华为昇腾后端支持;DeepGEMM-Ascend 和 DeepEP-Ascend 则是专门为昇腾平台新建的独立仓库,与 NVIDIA 版 DeepGEMM、DeepEP 完全兼容 API。

TileLang:比 CUDA 更简单的编程语言,这次加了昇腾后端

TileLang 是一个面向 GPU/CPU/加速器高性能内核开发的领域专用语言,此前已在英伟达平台被 DeepSeek 广泛使用,GitHub 上已有超过 7500 颗 Star。2026 年 9 月 30 日的更新为其新增了华为昇腾支持,官方说明是"沿用 NVIDIA 路径,内核现在提供第二个后端,运行时自动选择",也就是同一套 Python API 可以直接在 NVIDIA GPU 和华为 NPU 上运行,不需要开发者重写代码。

媒体报道中提到,相对英伟达的 CUDA 语言,TileLang 的编程更简单,能显著提高开发效率、简化代码逻辑,同时不损失硬件性能——这正是 TileLang 的设计初衷。

DeepGEMM-Ascend:矩阵乘法核心库,密集 GEMM 利用率达 99.8%

DeepGEMM-Ascend 是 DeepGEMM 在华为昇腾平台上的移植版本,完全兼容原版 API,支持 BF16、FP8、FP4 三种精度的 GEMM 运算,以及 MQA logits、MegaMoE 等算子。官方文档给出的实测数据(基于昇腾 950DT、CANN 9.20 环境)显示:

  • 密集 GEMM(Dense GEMM)在多种数据类型下利用率最高可达 99.8%(BF16×BF16,M=4096/N=7168/K=16384);
  • FP8×FP8 场景下利用率约 99.5%;
  • 分组 GEMM(M-Grouped GEMM,用于 DeepSeek MoE 专家计算)在 4 组/8 组专家配置下算力利用率普遍在 850 TFLOPS 左右。

官方特别提示,昇腾平台的缩放因子(scaling factor)存储格式与 NVIDIA 不同:每一对 UE8M0 缩放因子沿 K 维度打包进一个 int16,并按 MN-major 顺序存储以适配硬件效率,这是移植过程中需要单独处理的硬件差异点。

DeepEP-Ascend:专家并行通信库,dispatch 带宽达物理上限九成以上

DeepEP-Ascend 是面向华为昇腾 NPU 的高性能训练与推理通信库,提供 MoE dispatch/combine 的专家并行(EP)all-to-all 通信,支持 FP8 dispatch 和延迟 epilogue,公开的 buffer API 与 NVIDIA 版 DeepEP 保持一致。底层通过 HCCL/HCOMM、UBMEM 和 URMA 完成通信,运行时经由 DeepJIT 编译。

在昇腾 950DT、CANN 9.2.0 环境下的实测数据(16384 token/rank 容量、隐藏层 7168、256 专家 top-6 路由):

EP 规模Dispatch 带宽Combine 带宽
EP8373–375 GB/s345–347 GB/s
EP32335–340 GB/s320–324 GB/s
EP128313–320 GB/s272–278 GB/s

官方说明,在 EP 规模不超过 32 时,Dispatch 带宽能达到物理载荷带宽上限的约 90%~95%;更大规模的 EP 和 Combine 场景仍在持续优化中,涉及本地归约开销和 URMA 的 HBM 争用问题,华为也计划通过固件升级进一步降低这部分争用。

TileKernels、FlashMLA、DeepSelect:三个跨平台算子库同步支持昇腾

TileKernels 是基于 TileLang 实现的算子库合集,涵盖混合专家路由、Engram、量化、流形超连接(mHC)等大模型训练推理中的常见操作,本次更新新增了华为昇腾支持,同一套 Python API 可在 NVIDIA GPU 和华为 NPU 间自动切换运行时后端。

FlashMLA 是多头潜在注意力(Multi-head Latent Attention)的高效算子实现,GitHub Star 数已近 13000,是 DeepSeek 开源生态中关注度最高的项目之一,同样支持跨平台运行。

DeepSelect 是专为 DeepSeek 稀疏注意力(DSA,用于 DeepSeek V3.2、V4、V4.1 等模型)和采样器定制的高性能 TopK 算子,相比原生 torch.topk 可实现 2 到 20 倍加速,2026 年 9 月 30 日的更新为其发布了华为昇腾版本的 TopK 内核,此前已支持 NVIDIA CUDA 平台。

开发者怎么上手:安装方式与硬件门槛

六个项目的安装方式基本遵循 Python 生态的标准流程,以 DeepGEMM-Ascend 为例:

git clone --recursive https://github.com/deepseek-ai/DeepGEMM-Ascend.git
cd DeepGEMM-Ascend
pip install . --no-build-isolation

硬件和软件依赖方面,官方文档明确要求:

  • 华为昇腾 950 系列 NPU(部分项目在昇腾 950DT 上验证);
  • CANN 9.20 及以上工具链,提供 bin/bisheng、bin/ld.lld;
  • torch_npu 配套包,Python 3.10 及以上版本;
  • 支持 C++20 <format> 特性的编译器。

需要注意的是,DeepEP-Ascend 官方文档提到,完整满带宽运行还依赖华为 Atlas 850E 的 Q3 商用版 HDK(预计 2026 年 10 月中旬左右开放申请),当前 README 中的性能数据是基于提供给 DeepSeek 的 PoC 版本 HDK 测得,早期版本用户可能观察到带宽低于文档数值,这是硬件固件层面的差异,不代表软件本身存在问题。

常见问题

Q:这六个项目和 DeepSeek 之前面向英伟达平台的开源项目是什么关系?

官方明确说明所有昇腾组件与此前面向英伟达平台的开源组件一一对应:TileLang、TileKernels、FlashMLA、DeepSelect 是原有跨平台项目新增昇腾后端,DeepGEMM-Ascend、DeepEP-Ascend 则是专门为昇腾平台新建、API 与英伟达版本对齐的独立仓库。

Q:普通开发者没有昇腾硬件,还能用上这次开源的成果吗?

这批组件主要面向有昇腾 NPU 硬件、需要自行训练或部署大模型的团队。如果只是想调用 DeepSeek 系列模型做开发测试,不涉及自建训练推理集群,也可以直接使用云端已适配好的模型推理服务,例如七牛云 AI 大模型广场支持多款主流大模型统一接入,按需调用即可,不需要关心底层硬件适配细节。

Q:这次开源和"华为昇腾 950 超节点"是什么关系?

DeepSeek 官方在公告中提到,在面向昇腾平台的研发过程中华为团队给予了大力支持,双方已共同推进基于昇腾 950 的 128 卡超节点方案,本次开源的六个基础组件(尤其是 DeepEP-Ascend 的专家并行通信能力)正是支撑这类超节点规模化训练和推理的底层技术基础之一。

Q:DeepGEMM-Ascend 和 DeepEP-Ascend 目前是稳定版本吗?

从官方仓库信息看,两个项目均为 2026 年 9 月刚创建的新仓库,DeepGEMM-Ascend 标注为"昇腾 950 系列设备的首次发布",DeepEP-Ascend 的 Bucket 集合通信、专家负载均衡等部分能力仍在持续开发中,建议关注官方仓库的后续更新再评估是否用于生产环境。

结语

DeepSeek 这次开源的六个昇腾基础组件,覆盖了从编程语言、矩阵计算、通信库到具体算子的完整技术栈,且严格对标此前英伟达平台的开源生态,降低了开发者在两种硬件路径之间迁移的学习成本。六个项目目前都处于活跃更新阶段,部分能力仍在完善中,具体适用范围和性能表现建议以各项目 GitHub 仓库的最新 README 为准。本文内容以 DeepSeek 官方公众号公告、各项目 GitHub 仓库文档及 2026 年 9 月 30 日公开报道为准。

参考资料

  • TileLang GitHub 仓库:github.com/tile-ai/tilelang
  • DeepGEMM-Ascend GitHub 仓库:github.com/deepseek-ai/DeepGEMM-Ascend
  • DeepEP-Ascend GitHub 仓库:github.com/deepseek-ai/DeepEP-Ascend
  • TileKernels GitHub 仓库:github.com/deepseek-ai/TileKernels
  • FlashMLA GitHub 仓库:github.com/deepseek-ai/FlashMLA
  • DeepSelect GitHub 仓库:github.com/deepseek-ai/DeepSelect
  • 七牛云 AI 大模型广场:https://www.qiniu.com/ai/models
Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐