DeepSeek 把整套家底搬上昇腾:六大开源组件对标 CUDA,性能口径「接近硬件上限」
💡 一句话总结:9 月 30 日 DeepSeek 把自家训练用的核心组件——编译语言 TileLang 加五个计算/通信库——原样搬到了华为昇腾平台上开源,和英伟达版一一对应,官方称性能接近硬件理论上限。对中国 AI 算力生态来说,这是第一次有头部模型厂把「官方维护的组件级」软件栈供给给国产芯片。
导语:国产芯片缺的从来不是算力参数
在国产 AI 芯片上跑大模型是什么体验?问任何一个干过适配的工程师,大概率会收到一声叹息:芯片参数单看着都行,真跑起来,算子要自己写、通信库要自己凑、性能要自己调——硬件之上那一整层软件生态,才是最缺的东西。
CUDA 生态的护城河从来不是 CUDA 这门语言本身,而是十几年积累下来的算子库、通信库和工具链。9 月 30 日,DeepSeek 官宣了一个直指这层护城河的动作:把自家面向英伟达 GPU 开源过的整套基础设施组件,一一对应地搬到了华为昇腾平台上。
想看细节?
- 📰 权威媒体:量子位报道、观察者网
- 💻 开源仓库:TileLang(GitHub)
- 🌍 国际视角:Reuters 相关报道(转载)
开源了什么:一套「一一对应」的家底
这次开源的清单,Slogan 是「与此前面向英伟达平台的开源组件一一对应」。具体六个组件,各管一段:
| 组件 | 干什么用 |
|---|---|
| TileLang(昇腾版) | 高级语言编译工具——写算子用的「高级语言」,昇腾版负责把代码编译到芯片指令 |
| DeepGEMM | 通用矩阵运算加速——大模型计算里最吃量的那部分 |
| DeepEP | 分布式通信库——大规模跨设备高速通信 |
| TileKernels | 常规向量计算与访存算子——数据处理的基础件 |
| FlashMLA | 稀疏注意力算子——提升长上下文处理效率 |
| DeepSelect | 高效数据筛选 |
熟悉 DeepSeek 的朋友会发现,这份清单就是当年「DeepSeek 开源周」那套家底。区别在于:那次的目标平台是英伟达 GPU,这次是昇腾——不是演示性的「能跑」,而是整套生产级组件的平移。
TileLang:这次真正的支点
六个组件里,最值得单独讲的是 TileLang,因为它解决的是「生态能不能自己长大」的问题。
大模型算子开发长期有个两难:直接写底层指令(CUDA 或昇腾的 Ascend C),性能最好但又难又慢;用高级语言,写得快了性能又打折。TileLang 的定位是两头占:对下,昇腾版把 Ascend C 底层指令封装起来;对上,给开发者高级语言的编程体验。DeepSeek 的说法是:相对 CUDA,TileLang 编程更简单、能显著提高开发效率;相对其它同类高级语言,它的编程模型又能充分发挥芯片特性、摸到硬件性能上限。
最有分量的是这句官方表态:DeepSeek 训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。这不是「我们适配了几个示例算子」,而是「我们自己训练用的全套,都能在你这套硬件上跑出高性能」——这句话的含金量,比任何 benchmark 都高。
昇腾侧的配合也点得很明白:开放的 Ascend C API 支持对访存路径和计算流水线深度调优,PTO ISA 底层指令体系支撑了 TileLang 的编译对接——既照顾资深工程师手工调优的老路子,也接住高级语言的新范式。
「接近硬件理论上限」:这个口径怎么读
各媒体报道时都强调了这句:多项关键测试用例中,组件的计算与通信性能已接近硬件理论上限。快科技的标题更直接——「性能逼近硬件上限」。
量子位这篇报道有个特殊身份值得说明:文末标注「本文由华为提供」,属于利益相关方的联合创新通稿——但正因如此,它给出了别的转载稿没有的硬核数字:
- 组网方案:华为向 DeepSeek 提供联合定义的昇腾超节点 SuperPoD Flex 与 UBL128 组网——128 卡 3.2 Tbps 单层交换 Scale-up 网络,可扩展到 256K 卡两层交换 Scale-out;
- 通信实测:DeepEP 在 EP/CP/PP/FSDP 各模式下的互联带宽实测 Dispatch 375 GB/s、Combine 347 GB/s,接近硬件上限;
- 推理吞吐:基于 UBL128 超节点,DeepSeek-V4.1-Flash 在 EP32 部署、128K 上下文的 offline 推理中,TPOT=5ms 时单卡输出 2469 tokens/s,TPOT=10ms 时 5102 tokens/s(注:不含 Serving 调度与框架负载均衡开销)。
这里要给读者一个澄清:这些都是华为/DeepSeek 官方口径,目前还没有第三方的大规模独立实测。「接近理论上限」在体系结构领域是个很强的表述,但它天然依赖测试用例的选取——官方精选的用例和你的真实负载之间,通常有距离。方向可信(官方组件 + 训练自用背书),幅度待验(等第三方实测),这是目前比较稳妥的读法。
背后的大棋:去 CUDA 化的一步实棋
把镜头拉远,这次开源的意味会更清楚。路透社的报道把它放进「中国 AI 算力去 CUDA 化」的框架里,并提到双方合作涉及基于 128 颗昇腾 950 芯片的超节点(此细节仅见转引,未核到 Reuters 原文与华为官方规格,uncertain)。
配套动作也值得注意:华为把这次联合创新的成果在 CANN 社区批量开源——从大规模训练、低延时推理部署、超长文本 KV cache 池化到 Agentic RL,十余份技术报告与实践文档同步放出(gitcode.com/cann 仓库可查)。时间线上还有个铺垫:2025 年 3 月,北京大学联合华为发布过 DeepSeek 的全栈开源推理方案——但那是「社区组件整合」层面的部署方案。这次不一样:官方维护的算子 + 编译工具链,组件级供给,层次更低、复用价值更高。对 vLLM-Ascend、cann-recipes-infer 这类社区适配项目来说,这是互补而非替代——它们解决「模型在昇腾上能跑」,DeepSeek 这批组件解决「核心算子跑得快且有人长期维护」。
DeepSeek 自己把话说得很克制:希望这次开源能「对更多 AI 芯片建立高可用软件生态起到示范作用」。注意主语——不只是昇腾。TileLang 这个跨芯片编译层一旦跑通,同一套组件复制到其它国产芯片的路径就摆在那了。这才是「一套组件、多芯片适配」想象空间的起点。
把话说明白
对不同的人,这事的意义不一样:在昇腾上部署 DeepSeek 系模型的工程师,这次拿到的是官方维护的完整软件栈,适配成本实打实往下走;国产芯片厂商,看到的是「组件平移」这条路的可行性样板;普通开发者,短期内感知不强,但「换芯片不改稿」的基础设施正在铺。
需要保留的观察项也明确:性能口径是官方自报、组件的长期维护与 CANN 版本跟进是历史同类项目的常见衰减点、海外开发者社区的反馈还没形成。代码已经开放,接下来几个 GitHub star 数和 issue 区的热度,会比任何新闻稿都诚实。
参考来源
- DeepSeek 官方公众号官宣(一手/官方,经权威媒体全文转述)— 转述见量子位/观察者网报道
- 量子位:DeepSeek 官方开源昇腾基础组件(权威媒体)— https://www.qbitai.com/2026/09/499263.html
- 观察者网:与英伟达一一对应的组件清单与 TileLang 设计初衷(权威媒体)— https://www.guancha.cn/CaiJing/2026_09_30_902748.shtml
- 快科技:性能口径与开源链接清单(权威媒体)— https://news.mydrivers.com/1/1154/1154869.htm
- DoNews:组件分工明细(权威媒体)— https://www.donews.com/news/detail/1/6728132.html
- TileLang 开源仓库(一手/代码)— https://github.com/tile-ai/tilelang
- Reuters 相关报道(转载,超节点细节未核原文)— https://ca.headtopics.com/news/deepseek-and-huawei-partner-to-develop-programming-tools-88289040
- 北京大学联合华为全栈开源推理方案(背景,一手/机构)— https://hdipp.pku.edu.cn/info/1276/2643.htm
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐


所有评论(0)