2026 世界人工智能大会 WAIC 现场,华为Atlas 950 SuperPoD(昇腾 950 超节点) 真机首次亮相,并斩获大会最高 SAIL 大奖。很多参观者现场听到 “超节点”,容易听成 “奥特莱斯”,它并不是一款芯片,而是面向万亿参数大模型、Agent 智能体时代新一代算力底座。 随着 MoE 混合专家模型、超长上下文、多模态、大规模智能体训练普及,算力瓶颈早已不再是单芯片峰值性能,而是多卡协同通信墙。超节点,正是用来破解这一难题的核心架构。

一、到底什么是超节点(SuperPoD / SuperNode)

通俗定义

超节点不是多台服务器简单堆叠出来的传统集群。 它依靠自研专用高速互联,打破服务器机箱物理边界,把几十~上千颗 AI 加速芯片(NPU/GPU)封装成逻辑上单一的超级计算机。 物理上由多机柜组成;逻辑上所有加速卡共享统一资源空间,规避传统集群 “跨服务器通信开销巨大” 的痛点。

专业定义

超节点是一套紧耦合 Scale-Up 纵向扩展算力单元,具备三大标志性特征(行业公认标准):

  1. 全局统一内存编址 芯片可以直接寻址域内任意其他 NPU 显存,不需要传统 “数据打包→网络传输→拆包”,消除大量数据拷贝开销。
  2. 超大带宽、超低时延专用互联 Fabric 区别以太网、普通 IB,采用芯片直连高速总线;
  3. 无阻塞全互联拓扑 所有加速芯片对等互通,不存在明显收敛瓶颈,完美支撑 AllReduce、All-to-All 集合通信。

直观对比:传统 GPU 集群 VS 超节点集群

  • 传统分布式集群 最小单元:单台 8 卡服务器;服务器是天然边界。跨机依靠 RoCE/IB,时延数十微秒。适合数据并行、中小模型训练、常规推理。
  • 超节点(SuperPoD) 最小单元:数百卡紧耦合算力域;机箱边界被弱化。域内专用高速互联,时延低至数微秒。面向 MoE、张量并行、超大模型训练。
  • 超节点集群 多个独立 SuperPoD(超节点单元)之间,再通过高速 IB / 光网络横向组网,构建千卡 / 万卡级巨型智算中心。

比喻理解: 传统集群 = 很多独立办公室,沟通只能走外部走廊;

单个超节点 = 打通整层大楼,内部专属高速通道;

超节点集群 = 多栋打通楼层的大楼,楼间依靠高速干线连接。

二、华为昇腾 Atlas 超节点具体构成(Atlas 950 SuperPoD)

本次 WAIC 展出新一代 Atlas 950 SuperPoD,是昇腾第二代商用超节点,对标前代昇腾 384 SuperPoD。

1. 硬件分层架构(由内向外)

1)计算单元:昇腾 950DT NPU 单柜部署 64 卡 950DT,原生适配液冷高密度部署;

2)互联层核心:灵衢 UnifiedBus(UB)自研高速互联 采用 UB-Mesh 递归光直连拓扑,替代传统 PCIe 组网;实现柜内、跨机柜 NPU 全互联;

3)机柜组成:计算柜 + 灵衢互联交换柜 单超节点域最大支持 1024 张昇腾 950DT;整套系统可扩展至 8192 卡;
4)散热与供电:原生支持全浸没液冷,支撑单机柜百千瓦级功耗;

5)软件底座:CANN 昇腾驱动、分布式通信库、全局内存调度组件。

2. Atlas950 超节点核心关键参数(官方 WAIC 披露)

  • 最大域内规模:1024 卡昇腾 950DT
  • 全局统一内存编址空间:256TB
  • 灵衢互联 RTT 时延:3μs
  • 全域互联带宽:TB 级
  • FP8 算力:1 EFLOPS;FP4 算力:2 EFLOPS
  • 预计商用时间:2026 年 Q4

3. 两代昇腾超节点简单区分

  • 昇腾 384 SuperPoD(上一代,已商用 750 + 套):最大 384 卡规模;
  • Atlas950 SuperPoD(新一代 WAIC 首秀):升级至单域 1024 卡,统一内存、互联拓扑全面升级,面向十万亿参数模型与大规模 Agent 集群。

4. 对标参考

华为 Atlas SuperPoD(昇腾超节点) ↔ 英伟达 DGX SuperPod 灵衢 UB 互联 ↔ NVLink;UB-Mesh ↔ NVSwitch 交换架构。

三、超节点核心解决什么痛点?

大模型训练最大杀手:通信瓶颈 传统集群运行 MoE 混合专家模型、超大张量并行时,大量算力卡在等待数据传输,算力利用率 MFU 常常低于 30%。

  1. 打破通信墙 跨 NPU 数据交互绕开 CPU、PCIe 通道,域内通信时延降低一个数量级;MoE 模型重度依赖 All-to-All 通信,收益最为明显。
  2. 打破内存墙 分散各地的 NPU 显存池化为统一内存地址空间;长上下文推理 KV Cache、超大张量无需频繁交换内存。
  3. 降低分布式开发门槛 在超节点域内,开发者体验接近单机多卡;不需要复杂多层并行切分,大幅简化千亿、万亿模型分布式工程实现。

四、超节点典型应用方向

✅ 首选场景(超节点价值最大化)

  1. 万亿 / 十万亿参数稠密大模型预训练、持续预训练
  2. MoE 混合专家大模型训练与高并发推理(最契合超节点架构)
  3. 超长上下文、多模态大模型、大规模 Agent 智能体集群
  4. HPC 科学计算:分子动力学模拟、气候仿真、量子化学、CAE 有限元仿真

五、超节点带来的产业意义与行业影响

1. 算力竞争逻辑发生转变

AI 竞争从单芯片参数比拼 → 系统组织效率比拼。 就算单颗芯片性能存在差距,依靠超节点紧耦合架构,通过互联创新提升多卡协同效率,拉高整机有效算力利用率,实现体系层面追赶。

2. 国产智算基础设施关键底座

昇腾 Atlas 超节点是国内少数大规模商用的全国产千卡级紧耦合算力方案,支撑国内大模型企业自主可控算力底座建设,降低高端算力对外依赖。

3. 推动下一代智算中心建设标准

过去智算中心以 “单机柜服务器” 作为基本扩容单元;未来新建大型智算中心,越来越多厂商将超节点 SuperPoD作为基础建设单元。 从 “服务器集群时代” 迈入 “超节点集群时代”。

4. 降低前沿 AI 创新门槛

MoE、超大智能体、长序列模型对集群通信要求极高,很多初创企业难以搭建高效集群;标准化超节点方案可以降低大规模模型训练的工程难度,加速前沿模型迭代。

六、常见误区澄清

  1. ❌ 误区:超节点 = 多台服务器放一起 ✅ 正解:关键不在数量,在于专用高速互联 + 统一内存编址,普通服务器堆叠无论多少台都不能称为超节点。
  2. ❌ 误区:超节点只能用来训练大模型 ✅ 正解:同样适合高并发、超大上下文推理、科学仿真;但轻量化业务性价比不高。
  3. ❌ 误区:超节点 = 超节点集群 ✅ 正解:单个 SuperPoD 是一个算力域;多个 SuperPoD 跨域组网,才叫超节点集群。

七、总结

Agent AI 与万亿参数大模型时代,算力瓶颈由 “计算” 转向 “通信”。 超节点(SuperPoD)是面向下一代 AI 的系统级架构创新。 华为 WAIC 展出的 Atlas 950 SuperPoD,将国产超节点规模拓展至 1024 卡级别,依托灵衢 UB 统一互联与全局内存编址,打造国产千卡紧耦合算力标杆。 未来 3~5 年,无论是政企自建智算中心、头部 AI 企业算力基地,超节点架构将会成为高端大规模算力基础设施的主流选择。

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐