💡 一句话总结:9 月 30 日 DeepSeek 把自家训练用的核心组件——编译语言 TileLang 加五个计算/通信库——原样搬到了华为昇腾平台上开源,和英伟达版一一对应,官方称性能接近硬件理论上限。对中国 AI 算力生态来说,这是第一次有头部模型厂把「官方维护的组件级」软件栈供给给国产芯片。

导语:国产芯片缺的从来不是算力参数

在国产 AI 芯片上跑大模型是什么体验?问任何一个干过适配的工程师,大概率会收到一声叹息:芯片参数单看着都行,真跑起来,算子要自己写、通信库要自己凑、性能要自己调——硬件之上那一整层软件生态,才是最缺的东西。

CUDA 生态的护城河从来不是 CUDA 这门语言本身,而是十几年积累下来的算子库、通信库和工具链。9 月 30 日,DeepSeek 官宣了一个直指这层护城河的动作:把自家面向英伟达 GPU 开源过的整套基础设施组件,一一对应地搬到了华为昇腾平台上。

想看细节?

开源了什么:一套「一一对应」的家底

这次开源的清单,Slogan 是「与此前面向英伟达平台的开源组件一一对应」。具体六个组件,各管一段:

组件干什么用
TileLang(昇腾版)高级语言编译工具——写算子用的「高级语言」,昇腾版负责把代码编译到芯片指令
DeepGEMM通用矩阵运算加速——大模型计算里最吃量的那部分
DeepEP分布式通信库——大规模跨设备高速通信
TileKernels常规向量计算与访存算子——数据处理的基础件
FlashMLA稀疏注意力算子——提升长上下文处理效率
DeepSelect高效数据筛选

熟悉 DeepSeek 的朋友会发现,这份清单就是当年「DeepSeek 开源周」那套家底。区别在于:那次的目标平台是英伟达 GPU,这次是昇腾——不是演示性的「能跑」,而是整套生产级组件的平移。

TileLang:这次真正的支点

六个组件里,最值得单独讲的是 TileLang,因为它解决的是「生态能不能自己长大」的问题。

大模型算子开发长期有个两难:直接写底层指令(CUDA 或昇腾的 Ascend C),性能最好但又难又慢;用高级语言,写得快了性能又打折。TileLang 的定位是两头占:对下,昇腾版把 Ascend C 底层指令封装起来;对上,给开发者高级语言的编程体验。DeepSeek 的说法是:相对 CUDA,TileLang 编程更简单、能显著提高开发效率;相对其它同类高级语言,它的编程模型又能充分发挥芯片特性、摸到硬件性能上限。

最有分量的是这句官方表态:DeepSeek 训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。这不是「我们适配了几个示例算子」,而是「我们自己训练用的全套,都能在你这套硬件上跑出高性能」——这句话的含金量,比任何 benchmark 都高。

昇腾侧的配合也点得很明白:开放的 Ascend C API 支持对访存路径和计算流水线深度调优,PTO ISA 底层指令体系支撑了 TileLang 的编译对接——既照顾资深工程师手工调优的老路子,也接住高级语言的新范式。

「接近硬件理论上限」:这个口径怎么读

各媒体报道时都强调了这句:多项关键测试用例中,组件的计算与通信性能已接近硬件理论上限。快科技的标题更直接——「性能逼近硬件上限」。

量子位这篇报道有个特殊身份值得说明:文末标注「本文由华为提供」,属于利益相关方的联合创新通稿——但正因如此,它给出了别的转载稿没有的硬核数字:

  • 组网方案:华为向 DeepSeek 提供联合定义的昇腾超节点 SuperPoD Flex 与 UBL128 组网——128 卡 3.2 Tbps 单层交换 Scale-up 网络,可扩展到 256K 卡两层交换 Scale-out;
  • 通信实测:DeepEP 在 EP/CP/PP/FSDP 各模式下的互联带宽实测 Dispatch 375 GB/s、Combine 347 GB/s,接近硬件上限;
  • 推理吞吐:基于 UBL128 超节点,DeepSeek-V4.1-Flash 在 EP32 部署、128K 上下文的 offline 推理中,TPOT=5ms 时单卡输出 2469 tokens/s,TPOT=10ms 时 5102 tokens/s(注:不含 Serving 调度与框架负载均衡开销)。

这里要给读者一个澄清:这些都是华为/DeepSeek 官方口径,目前还没有第三方的大规模独立实测。「接近理论上限」在体系结构领域是个很强的表述,但它天然依赖测试用例的选取——官方精选的用例和你的真实负载之间,通常有距离。方向可信(官方组件 + 训练自用背书),幅度待验(等第三方实测),这是目前比较稳妥的读法。

背后的大棋:去 CUDA 化的一步实棋

把镜头拉远,这次开源的意味会更清楚。路透社的报道把它放进「中国 AI 算力去 CUDA 化」的框架里,并提到双方合作涉及基于 128 颗昇腾 950 芯片的超节点(此细节仅见转引,未核到 Reuters 原文与华为官方规格,uncertain)。

配套动作也值得注意:华为把这次联合创新的成果在 CANN 社区批量开源——从大规模训练、低延时推理部署、超长文本 KV cache 池化到 Agentic RL,十余份技术报告与实践文档同步放出(gitcode.com/cann 仓库可查)。时间线上还有个铺垫:2025 年 3 月,北京大学联合华为发布过 DeepSeek 的全栈开源推理方案——但那是「社区组件整合」层面的部署方案。这次不一样:官方维护的算子 + 编译工具链,组件级供给,层次更低、复用价值更高。对 vLLM-Ascend、cann-recipes-infer 这类社区适配项目来说,这是互补而非替代——它们解决「模型在昇腾上能跑」,DeepSeek 这批组件解决「核心算子跑得快且有人长期维护」。

DeepSeek 自己把话说得很克制:希望这次开源能「对更多 AI 芯片建立高可用软件生态起到示范作用」。注意主语——不只是昇腾。TileLang 这个跨芯片编译层一旦跑通,同一套组件复制到其它国产芯片的路径就摆在那了。这才是「一套组件、多芯片适配」想象空间的起点。

把话说明白

对不同的人,这事的意义不一样:在昇腾上部署 DeepSeek 系模型的工程师,这次拿到的是官方维护的完整软件栈,适配成本实打实往下走;国产芯片厂商,看到的是「组件平移」这条路的可行性样板;普通开发者,短期内感知不强,但「换芯片不改稿」的基础设施正在铺。

需要保留的观察项也明确:性能口径是官方自报、组件的长期维护与 CANN 版本跟进是历史同类项目的常见衰减点、海外开发者社区的反馈还没形成。代码已经开放,接下来几个 GitHub star 数和 issue 区的热度,会比任何新闻稿都诚实。


参考来源

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐