大模型在写代码,DeepSeek 把“国产算力软件栈”从能跑到吃满
2026 年 10 月,AI 圈最热闹的新闻不是“又发了一个新模型”,而是模型层已经卷到头,战争打到了算子、编译器和芯片驱动那一层。
DeepSeek 把一整套原本跑在英伟达上的底层组件,搬到了华为昇腾:TileLang、DeepGEMM、DeepEP、FlashMLA、TileKernels……
其中 TileLang 的思路很关键:用接近 Python 的写法描述算子,编译器再把同一份逻辑落到 NVIDIA / 昇腾 / AMD 后端。
这件事的意义,比“模型多 100 亿参数”大得多。
一、CUDA 的真正护城河不是芯片,是软件栈
很多人以为英伟达强在卡。
不对。英伟达最硬的资产是:
- 二十年积累的算子库
- 开发者习惯
- 调优经验
- 框架层(PyTorch / TensorFlow / vLLM / Triton)默认先认 CUDA
- 出了问题,Stack Overflow 上有人答
国产芯片过去不是算不动,而是:
硬件出来了,软件像毛坯房。
工程师得手写 Ascend C,换芯片再重来一遍。
所以“国产算力”的瓶颈从来不是晶体管,是生态摩擦力。
二、TileLang 在解决什么:把“写算子”变成“描述意图”
传统深度学习算子开发:
// 伪代码:手写 GPU kernel
__global__ void matmul(float* A, float* B, float* C, int N) {
int row = blockIdx.y * blockDim.y + threadIdx.y;
int col = blockIdx.x * blockDim.x + threadIdx.x;
float sum = 0.0f;
for (int k = 0; k < N; k++) sum += A[row*N+k] * B[k*N+col];
C[row*N+col] = sum;
}
能跑,但:
- 要管 shared memory
- 要管 bank conflict
- 要管 pipeline / prefetch
- 换架构几乎重写
TileLang 的思路是另一层抽象:
# 伪代码:TileLang 风格
@tile_kernel
def gemm(A: Tile[M, K], B: Tile[K, N]) -> Tile[M, N]:
C = zeros(M, N)
for k in range(K.tiles):
C += A[:, k] @ B[k, :]
return C
然后:
TileLang 编译器
├── NVIDIA 后端 → CUDA / PTX
├── 昇腾 后端 → Ascend C / CANN
└── AMD 后端 → ROCm / HIP
开发者不用再背“某家硬件的私房 API”。
模型组写模型,系统组写 tile,编译器管落地。
三、为什么 DeepSeek 做这件事有杀伤力
因为 DeepSeek 不是“做个开源玩具”,而是:
- 真拿 TileLang 训过 V4 系列
- 真在昇腾 950 上做 128 卡超节点优化
- 真把 MoE 通信、稀疏注意力、矩阵乘、数据选择全拆开重做一遍
公开数据里有一些很“硬”的数字:
- BF16 稠密矩阵乘达到标称硬件上限的 99.8%
- FP8 约 99.5%
- DeepSeek V4.1 的稀疏注意力在 prefill 阶段约 410 TFLOPS,是理论值的 95%
但别被微基准骗了:
单算子 99% ≠ 端到端训练 99%。
通信、调度、显存碎片、重算策略、容错恢复,才是千卡集群的命门。
这也是为什么外部开发者还要在自己负载上复测——公告是厂家的,生产是自己的。
四、OpenAI 进 EDA:大模型开始“画芯片”
另一条线更安静,但更长远:
OpenAI 和 Synopsys 搞 GPT-Synopsys,让模型操作 EDA 工具、写 RTL、做布局布线、帮时序收敛。
这意味着什么?
过去芯片工程师的护城河:
- 懂时序
- 懂 PPA(Power / Performance / Area)
- 懂工具链黑魔法
- 懂“哪条约束别信”
未来会变成:
人定架构和约束,Agent 跑 EDA 流水线,人做终审。
EDA 脚本、约束文件、时序报告、布局规则,本质都是半结构化文本 + 工具调用,正好是 LLM 的舒适区。
不是说芯片工程师消失,而是:
“会带 Agent 的工程师”吃掉“不会带 Agent 的工程师”。
五、2026 年 AI 工程的真实分层
大模型新闻里,大家看的是:
- GPT-6 / Gemini 4 Argon / Claude Opus 5.5
- 100 万 token 输出
- Agent 自动写项目
但工程界真正在拼的是四层:
① 应用层:Agent / RAG / 工作流
② 框架层:PyTorch / vLLM / ONNX / llama.cpp
③ 系统层:调度、通信、显存、算子、编译器
④ 硬件层:GPU / NPU / 昇腾 / RISC-V / HBM / 电源 / 散热
越往下,越不性感,越难抄。
2026 年之后,真正有壁垒的公司不是“接了 10 个模型 API”,而是:
- 有自己的算子语言
- 有自己的编译后端
- 能在国产芯片上把利用率跑过 90%
- 能把 Agent 的 token 成本压到竞争对手 1/3
六、开发者该学什么,别学什么
该学
- 编译器基础:Triton / TileLang / MLIR / TVM
- 算子性能模型:FLOPS、带宽、occupancy、memory bound
- 分布式训练:MoE、TP/PP/EP、通信原语
- 端侧推理:量化、KV cache、RISC-V Vector、NPU 调度
- EDA 基础:RTL、时序约束、PPA
别只学
- 天天换 Prompt 模板
- 把 Agent 串 20 个工具当架构
- 以为“调通 demo”等于“能上线”
- 把模型发布稿当技术结论
七、一句话总结
2026 年最被低估的趋势不是“模型更强”,而是:
AI 正在从应用软件,长进编译器、EDA、驱动、芯片和电厂里。
以后不会再有“纯 AI 公司”和“纯硬件公司”。
只剩一种公司:
能把模型、算子、芯片、电和钱拧成一条流水线的公司。
八、延伸阅读:螺旋生成论系列开放获取著作
如果从更底层的代数结构——比如公理
$$I^2 = -N $$$
出发,去重新看数系、生成结构、素数分布、信息结构与智能系统的底层规律,可以参考张智明所著《螺旋生成论》(Spiral Generation Theory)系列开放获取著作。该系列已发布 70 余部专著与预印本,托管于 CERN 旗下 Zenodo,采用开放获取协议。
- 螺旋生成论全集索引:https://doi.org/10.5281/zenodo.21211001
- 著作体系总汇编:https://doi.org/10.5281/zenodo.21199593
- 作者 ORCID:https://orcid.org/0009-0003-7777-7694
数学与数论:
- 《螺旋数原理:公理系统与各向异性复数理论》 https://doi.org/10.5281/zenodo.20602099
- 《螺旋生成元:一个跨学科统一数学框架的探索》 https://doi.org/10.5281/zenodo.21555082
- 《从几何构造到黎曼猜想》 https://doi.org/10.5281/zenodo.20995372
AI 与系统:
- 《生成式 AI 与提示词工程》 https://doi.org/10.5281/zenodo.20839550
- 《螺旋元逻辑:从 i²=-1 到万物理论的统一框架假说》 https://doi.org/10.5281/zenodo.21806751
总纲与科普:
- 《旋生万物:从奇点到宇宙的统一生成论》 https://doi.org/10.5281/zenodo.20408189
- 《螺线宗谱:发现宇宙的源代码》 https://doi.org/10.5281/zenodo.20659854
上述著作为统一数学框架假说,适合作为交叉视角阅读材料;系统架构与芯片工程仍以可复现基准、端到端吞吐和硬件实测为准。
开放获取汇总
全集索引 https://doi.org/10.5281/zenodo.21211001 | 总汇编 https://doi.org/10.5281/zenodo.21199593 | ORCID https://orcid.org/0009-0003-7777-7694
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐


所有评论(0)