一、引言:从“卡时代”到“超节点时代”

 

在AI算力竞赛中,单纯比拼显卡数量的时代正在过去。当集群规模突破千卡、万卡,系统级的互联效率与协同能力才是决定胜负的关键。

 

2026年7月,华为在WAIC上首次公开展示了昇腾950超节点(Atlas 950 SuperPoD) 真机。这个搭载1024张昇腾950DT芯片的“庞然大物”,其FP8总算力达到1 EFLOPS。简单换算,相当于约3205张英伟达A100显卡的算力总和。本文将从算力、互联、内存等维度,深入解析这一国产算力重器。

 

二、昇腾950超节点:规格详解

 

昇腾950超节点以单柜64卡为基本单元,由16台计算柜组成。核心规格如下:

 

配置项 具体参数

芯片 昇腾950DT

卡数 1024张

总算力 (FP8) 1 EFLOPS(每秒百亿亿次浮点运算)

总算力 (FP4) 2 EFLOPS

全局统一内存 256TB

互联带宽 TB级 NPU互联带宽

通信时延 3μs 超低RTT时延

设计上限 可扩展至8192张昇腾950DT卡

 

三、算力换算:1 EFLOPS ≈ 3205张A100

 

· 昇腾950超节点(FP8):总算力 1,000,000 TFLOPS (1 EFLOPS)。

· 英伟达A100(FP16):单卡算力 312 TFLOPS。

· 等效换算:1,000,000 ÷ 312 ≈ 3,205 张。

 

补充说明:此换算基于理论峰值算力。昇腾950侧重FP8低精度AI推理,A100侧重FP16混合精度训练。实际性能会受软件生态、显存带宽等因素影响,但数量级上的震撼是确定的。

 

四、不止于算力:真正的“杀手锏”

 

昇腾950超节点的真正价值,在于其系统级创新:

 

1. “灵衢”互联:让1024卡像一台计算机

基于自研灵衢(UnifiedBus) 互联协议,实现TB级带宽和3μs超低时延。1024张卡高速互联,如同一台计算机般协同工作。

 

2. 256TB统一内存编址:打破“内存墙”

拥有256TB全局统一内存编址空间,所有GPU可直接访问同一内存池,无需手动数据搬运,极大简化万亿参数大模型的训练。

 

3. 业界验证:前代已商用750+套

前代昇腾384超节点已商用落地750多套,覆盖互联网、金融、医疗等20多个行业。

 

五、国产算力的“系统级”胜利

 

昇腾950超节点带来的启示是:当单卡性能追赶时,系统级创新才是超车的真正路径。

 

对比同期英伟达NVL144(144卡集群),昇腾950超节点(1024卡)的总算力达到其6.7倍。这不仅是芯片的胜利,更是互联、内存、架构全面系统创新的胜利。

 

六、展望:从1024卡到8192卡

 

根据华为路线图,Atlas 950 SuperPoD设计上限为8192张昇腾950DT卡,届时FP8总算力将达8 EFLOPS。基于该超节点打造的Atlas 950 SuperCluster集群,更可扩展至50万卡。

 

“3205张A100”只是一个数字,其背后是国产AI算力从“卡时代”迈向“超节点时代”的坚实一步。当1024颗“中国芯”高效协同,迸发出的算力足以支撑中国AI的未来。

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐