DeepSeek开源昇腾全套组件:TileLang对标CUDA,国产算力补上软件一环
9月30日,DeepSeek 在官方渠道宣布,正式开源面向华为昇腾算力平台的全套基础设施组件,包括 TileLang 高级语言编译工具、高性能计算库、分布式通信库。据多家媒体报道,这批组件与 DeepSeek 此前面向英伟达平台开源的那一套"一一对应"。
这事听起来很底层,离日常写业务代码很远。但它其实回答了一个问题:国产 AI 芯片想跑大模型,软件栈这一环到底补齐了没有。
这次发布的到底是什么
具体来看,随 TileLang 一同开源的还有五个组件:
- DeepGEMM:矩阵运算,主要影响计算单元的利用率
-
- DeepEP:跨设备通信,负责多卡、超节点之间的数据搬运
-
- TileKernels:常规向量计算与访存算子
-
- FlashMLA:稀疏注意力算子,针对长上下文场景
-
- DeepSelect:数据筛选
用 DeepSeek 的说法,这些组件覆盖了模型运行中的关键环节——矩阵运算、通信、访存、注意力、筛选。据其披露,在多项关键测试用例中,这些组件的计算与通信性能已接近硬件上限。
- DeepSelect:数据筛选
TileLang 的技术本质:把"写算子"这件事降门槛
要理解这次发布的分量,得先知道算子是什么。大模型跑起来,底层是一堆矩阵乘、注意力这类计算。为了让芯片跑满,工程师得写"算子"(kernel)——直接用 CUDA 或芯片底层指令,精细控制显存、分块、并行。写起来难,调起来更难。
CUDA 的问题是:闭源、全栈、和英伟达硬件深度绑定,生态深但迁移成本极高。你想换一块芯片,整套底层逻辑几乎要推倒重来。
TileLang 走的是另一条路:开源的、聚焦算子开发的、跨硬件的编程语言。它的设计里,把"为哪款芯片生成指令"和"怎么编译运行"这两件事解耦,所以同一套代码理论上能适配不同芯片后端。
据 DeepSeek 介绍,相较于昇腾原生的 Ascend C 底层语言,TileLang 昇腾版大幅简化了编程模型,同时保持硬件性能。团队还表示,训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。
关键的一句是:这套路线先在英伟达平台上验证过,目前承载了 DeepSeek V4 系列模型训练里大部分算子的实现。也就是说,它不是纸上方案,是在自家训练里跑出来的。
和之前比,变了什么、没变什么
变了的是:以前"用国产芯片训大模型",难点不只在芯片本身,还在软件生态——工具链、算子库、通信库都得重造。现在至少有一条通道,可以让原本为英伟达写的东西,以较低成本迁移到昇腾上。据媒体报道,双方还共同推进了基于昇腾 950 的 128 卡超节点方案,并对计算与通信做了深度优化。
没变的是:这不等于英伟达的护城河一夜消失。CUDA 十几年积累,生态、文档、社区、调试工具都不是短期能追平的。而且据相关报道,华为芯片本身还面临先进内存等元器件短缺带来的供货瓶颈,短期替代并不现实。
对普通开发者意味着什么
如果你是写业务代码的,这件事的直接感受可能为零。但往下看两层,能看到几个实际影响:
- 岗位机会:懂算子、懂性能优化、能在昇腾和 CUDA 之间迁移的人,会变得更稀缺。这是典型的"底层功力"岗位。
-
- 成本传导:国产算力生态越成熟,推理和训练成本越有可能下降。云厂商和自建推理的团队,对"换不换芯片"会开始有真实选项。
-
- 学习路径:类 CUDA 的高级算子语言值得关注。据相关报道,TileLang 这类工具的目标是"写得更简单、性能不打折",如果能兑现,学习曲线会比直接啃 Ascend C 平缓。
坑在哪
- 生态早期,文档和社区答案少,踩坑基本靠自己。
-
- 别把"开源"等同于"开箱即用"。跨芯片跑起来,性能调优仍然要花功夫。
-
- 商用落地前,先确认芯片供货和云上实例的可得性,别把架构设计押在一个拿不到货的方案上。
结尾
从大模型竞争的角度看,算力的竞争正在从"谁的芯片强"往"谁的软件栈能用、好用"延伸。软件定义算力这句话,以前更像口号,现在有了具体的组件清单。
你觉得国产算力生态的卡点是在芯片,还是在软件?评论区聊聊。
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐

所有评论(0)