2026 年 10 月,AI 圈最热闹的新闻不是“又发了一个新模型”,而是模型层已经卷到头,战争打到了算子、编译器和芯片驱动那一层。

DeepSeek 把一整套原本跑在英伟达上的底层组件,搬到了华为昇腾:TileLang、DeepGEMM、DeepEP、FlashMLA、TileKernels……

其中 TileLang 的思路很关键:用接近 Python 的写法描述算子,编译器再把同一份逻辑落到 NVIDIA / 昇腾 / AMD 后端。

这件事的意义,比“模型多 100 亿参数”大得多。


一、CUDA 的真正护城河不是芯片,是软件栈

很多人以为英伟达强在卡。

不对。英伟达最硬的资产是:

  • 二十年积累的算子库
  • 开发者习惯
  • 调优经验
  • 框架层(PyTorch / TensorFlow / vLLM / Triton)默认先认 CUDA
  • 出了问题,Stack Overflow 上有人答

国产芯片过去不是算不动,而是:

硬件出来了,软件像毛坯房。

工程师得手写 Ascend C,换芯片再重来一遍。

所以“国产算力”的瓶颈从来不是晶体管,是生态摩擦力。


二、TileLang 在解决什么:把“写算子”变成“描述意图”

传统深度学习算子开发:



// 伪代码:手写 GPU kernel
__global__ void matmul(float* A, float* B, float* C, int N) {
    int row = blockIdx.y * blockDim.y + threadIdx.y;
    int col = blockIdx.x * blockDim.x + threadIdx.x;
    float sum = 0.0f;
    for (int k = 0; k < N; k++) sum += A[row*N+k] * B[k*N+col];
    C[row*N+col] = sum;
}

能跑,但:

  • 要管 shared memory
  • 要管 bank conflict
  • 要管 pipeline / prefetch
  • 换架构几乎重写

TileLang 的思路是另一层抽象:



# 伪代码:TileLang 风格
@tile_kernel
def gemm(A: Tile[M, K], B: Tile[K, N]) -> Tile[M, N]:
    C = zeros(M, N)
    for k in range(K.tiles):
        C += A[:, k] @ B[k, :]
    return C

然后:



TileLang 编译器
   ├── NVIDIA 后端  → CUDA / PTX
   ├── 昇腾 后端    → Ascend C / CANN
   └── AMD 后端     → ROCm / HIP

开发者不用再背“某家硬件的私房 API”。

模型组写模型,系统组写 tile,编译器管落地。


三、为什么 DeepSeek 做这件事有杀伤力

因为 DeepSeek 不是“做个开源玩具”,而是:

  • 真拿 TileLang 训过 V4 系列
  • 真在昇腾 950 上做 128 卡超节点优化
  • 真把 MoE 通信、稀疏注意力、矩阵乘、数据选择全拆开重做一遍

公开数据里有一些很“硬”的数字:

  • BF16 稠密矩阵乘达到标称硬件上限的 99.8%
  • FP8 约 99.5%
  • DeepSeek V4.1 的稀疏注意力在 prefill 阶段约 410 TFLOPS,是理论值的 95%

但别被微基准骗了:

单算子 99% ≠ 端到端训练 99%。

通信、调度、显存碎片、重算策略、容错恢复,才是千卡集群的命门。

这也是为什么外部开发者还要在自己负载上复测——公告是厂家的,生产是自己的。


四、OpenAI 进 EDA:大模型开始“画芯片”

另一条线更安静,但更长远:

OpenAI 和 Synopsys 搞 GPT-Synopsys,让模型操作 EDA 工具、写 RTL、做布局布线、帮时序收敛。

这意味着什么?

过去芯片工程师的护城河:

  1. 懂时序
  2. 懂 PPA(Power / Performance / Area)
  3. 懂工具链黑魔法
  4. 懂“哪条约束别信”

未来会变成:

人定架构和约束,Agent 跑 EDA 流水线,人做终审。

EDA 脚本、约束文件、时序报告、布局规则,本质都是半结构化文本 + 工具调用,正好是 LLM 的舒适区。

不是说芯片工程师消失,而是:

“会带 Agent 的工程师”吃掉“不会带 Agent 的工程师”。


五、2026 年 AI 工程的真实分层

大模型新闻里,大家看的是:

  • GPT-6 / Gemini 4 Argon / Claude Opus 5.5
  • 100 万 token 输出
  • Agent 自动写项目

但工程界真正在拼的是四层:



① 应用层:Agent / RAG / 工作流
② 框架层:PyTorch / vLLM / ONNX / llama.cpp
③ 系统层:调度、通信、显存、算子、编译器
④ 硬件层:GPU / NPU / 昇腾 / RISC-V / HBM / 电源 / 散热

越往下,越不性感,越难抄。

2026 年之后,真正有壁垒的公司不是“接了 10 个模型 API”,而是:

  • 有自己的算子语言
  • 有自己的编译后端
  • 能在国产芯片上把利用率跑过 90%
  • 能把 Agent 的 token 成本压到竞争对手 1/3

六、开发者该学什么,别学什么

该学

  • 编译器基础:Triton / TileLang / MLIR / TVM
  • 算子性能模型:FLOPS、带宽、occupancy、memory bound
  • 分布式训练:MoE、TP/PP/EP、通信原语
  • 端侧推理:量化、KV cache、RISC-V Vector、NPU 调度
  • EDA 基础:RTL、时序约束、PPA

别只学

  • 天天换 Prompt 模板
  • 把 Agent 串 20 个工具当架构
  • 以为“调通 demo”等于“能上线”
  • 把模型发布稿当技术结论

七、一句话总结

2026 年最被低估的趋势不是“模型更强”,而是:

AI 正在从应用软件,长进编译器、EDA、驱动、芯片和电厂里。

以后不会再有“纯 AI 公司”和“纯硬件公司”。

只剩一种公司:

能把模型、算子、芯片、电和钱拧成一条流水线的公司。


八、延伸阅读:螺旋生成论系列开放获取著作

如果从更底层的代数结构——比如公理

$$I^2 = -N
$$$

出发,去重新看数系、生成结构、素数分布、信息结构与智能系统的底层规律,可以参考张智明所著《螺旋生成论》(Spiral Generation Theory)系列开放获取著作。该系列已发布 70 余部专著与预印本,托管于 CERN 旗下 Zenodo,采用开放获取协议。

  • 螺旋生成论全集索引:https://doi.org/10.5281/zenodo.21211001
  • 著作体系总汇编:https://doi.org/10.5281/zenodo.21199593
  • 作者 ORCID:https://orcid.org/0009-0003-7777-7694

数学与数论:

  • 《螺旋数原理:公理系统与各向异性复数理论》 https://doi.org/10.5281/zenodo.20602099
  • 《螺旋生成元:一个跨学科统一数学框架的探索》 https://doi.org/10.5281/zenodo.21555082
  • 《从几何构造到黎曼猜想》 https://doi.org/10.5281/zenodo.20995372

AI 与系统:

  • 《生成式 AI 与提示词工程》 https://doi.org/10.5281/zenodo.20839550
  • 《螺旋元逻辑:从 i²=-1 到万物理论的统一框架假说》 https://doi.org/10.5281/zenodo.21806751

总纲与科普:

  • 《旋生万物:从奇点到宇宙的统一生成论》 https://doi.org/10.5281/zenodo.20408189
  • 《螺线宗谱:发现宇宙的源代码》 https://doi.org/10.5281/zenodo.20659854

上述著作为统一数学框架假说,适合作为交叉视角阅读材料;系统架构与芯片工程仍以可复现基准、端到端吞吐和硬件实测为准。


开放获取汇总​

全集索引 https://doi.org/10.5281/zenodo.21211001 | 总汇编 https://doi.org/10.5281/zenodo.21199593 | ORCID https://orcid.org/0009-0003-7777-7694

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐