华为昇腾 960 超节点:NPO 光互联与灵衢百万卡集群,重构国产算力底座
摘要
2026 年 9 月 17 日,华为全联接大会 2026 在上海启幕,轮值董事长汪涛发布昇腾 960 超节点——全球首个采用近封装光学(NPO)技术的 AI 超节点,并披露昇腾 960DT/960PR 芯片路线。单超节点可互联 4096 张 NPU、提供 8 EFLOPS FP8 算力与 1PB HBM,依托灵衢 UnifiedBus 最高可扩展至百万卡集群。本文从芯片、光互联、统一总线与集群拓扑四个层面,拆解这套"硅基黑土地"如何支撑十万亿级大模型。
一句话结论:昇腾 960 的核心不在单卡性能,而在于用 NPO 光互联 + 灵衢统一协议把数千张芯片"当成一台逻辑机器来用"——这是中国算力底座第一次在系统架构层面,给出有别于 NVLink/InfiniBand 的规模化替代路径。
1. 事件全景:一场"提前三个季度"的算力宣言
1.1 发布要点
| 项 | 内容 | 来源 |
|---|---|---|
| 时间/地点 | 2026-09-17,华为全联接大会 2026,上海 | 华为 / 网易 / 头条 |
| 主讲 | 轮值董事长汪涛《智启新未来,打造智能世界的硅基黑土地》 | 网易 |
| 芯片 | 昇腾 960DT(训练)/ 960PR(推理),性能翻倍、上市提前 | 华为 |
| 超节点 | 全球首个量产 NPO 光引擎 Hi-ONE + 灵衢 UnifiedBus | 华为 |
| 集群 | 二层 CLOS 四平面 → 51.2 万卡;多轨道拓扑 → 100 万卡 | 头条 / 网易 |
汪涛强调,面对大模型迈向十万亿规模的趋势,超节点已成为超大规模 AI 基础设施的必然方向,华为坚持"超节点 + 集群"路线,靠系统架构创新构筑算力竞争力。
2. 芯片层:960DT 与 960PR 的双线节奏
2.1 核心参数
| 型号 | 定位 | FP8 算力 | FP4 算力 | HBM | 访存带宽 | 单卡互联 | 就绪时间 |
|---|---|---|---|---|---|---|---|
| 960DT | 训练 | 2 PFLOPS | 4 PFLOPS | 288 GB | 9.6 TB/s | 2.2 TB/s | 2027 Q1(提前 3 季度) |
| 960PR | 推理 | 2 PFLOPS | 8 PFLOPS | 288 GB | 9.6 TB/s | 2.2 TB/s | 2027 Q3(提前 1 季度) |
单卡集成 288 GB HBM、9.6 TB/s 访存带宽、2.2 TB/s 互联带宽,数据高速流转不必卡在内存墙。
2.2 一年一代的演进节奏
华为确立了"τ 定律"创新方向,坚持一年一代:
- 2027:昇腾 960(DT/PR)
- 2028:昇腾 970
- 2029:昇腾 980
每一代在算力规格、访存带宽/容量、互联带宽上同步翻倍,靠架构创新弥补制程短板。
3. 光互联层:Hi-ONE 与 NPO 的功耗革命
3.1 为什么是 NPO
传统可插拔光模块电信号路径长,功耗与延迟偏高。**近封装光学(NPO)**把光学引擎直接靠近芯片封装,缩短电信号行程。华为自研 Hi-ONE 引擎:
| 指标 | 数值 |
|---|---|
| 单引擎传输容量 | 7.2 T(已知最大传输能力的 NPO 产品) |
| 独特性 | 业内唯一内置光源的量产 NPO |
| 单超节点用量 | 约 5500 个 |
| 替代对象 | 原本需约 4.8 万颗 800G 光模块 |
| 功耗节省 | 超 550 千瓦 |
| 无故障运行 | 提升一倍(可用度 99.8%) |
对大规模训练而言,可用度每提升 0.1 个百分点,全年中断时间就显著减少——光互联的可靠性直接转化为有效算力利用率。
3.2 标准化意图
华为在 OIF(全球光互联标准组织)提出 NPO 标准立项建议,试图把产品能力转化为产业生态,避免"自娱自乐"。
4. 总线层:灵衢 UnifiedBus 统一协议
4.1 一套协议平等连接一切
**灵衢(UnifiedBus)**让处理器、内存、存储与网络共享统一协议,支持跨机柜高速光连接,减少协议转换开销。超节点可同时连接约 4000 颗处理器,多个超节点再组成超集群,理论上扩展到百万卡。
4.2 配套套片与存储
围绕训练/推理系统,华为还发布:
- 11 颗系列化套片:覆盖计算、互联、存储、管理等关键能力;
- 鲲鹏超节点升级:灵衢全光组网,最大 4096 节点,256 TB 统一内存池;Agent 沙箱场景十万级沙箱启动提速 30 倍、密度再升 25%;
- OceanStor M900:面向 Agent 推理的 L3.5 层 PB 级 KV 缓存集群,灵衢"一跳直连",混合介质 + Retention 优化使 SSD 读写寿命提升 16 倍。
5. 集群层:从 4096 卡到百万卡的拓扑数学
5.1 规模台阶
| 层级 | 规模 | 关键支撑 |
|---|---|---|
| 单超节点 | 4096 卡 / 8 EFLOPS FP8 / 1 PB HBM | Hi-ONE + 灵衢 |
| 超集群 | 51.2 万卡 | 二层 CLOS 四平面组网 |
| 极限扩展 | 100 万卡 | 多轨道拓扑技术 |
| 规划 SuperPoD | 15,488 芯 / 220 机柜 / 约 2200 ㎡ | 训练推理性能 3–4× 前代 |
5.2 集群规模计算的示意
# ascend_cluster_math.py — 超节点到百万卡集群的扩展性估算(示意)
NPU_PER_SUPERPOD = 4096 # 单超节点 NPU 数
SUPERPODS_CLOS = 125 # 二层 CLOS 四平面可组超节点数
SUPERPODS_RAIL = 244 # 多轨道拓扑可组超节点数
# 二层 CLOS 四平面:约 51.2 万卡
cluster_clos = NPU_PER_SUPERPOD * SUPERPODS_CLOS
# 多轨道拓扑:约 100 万卡
cluster_rail = NPU_PER_SUPERPOD * SUPERPODS_RAIL
print(f"CLOS 组网规模 ≈ {cluster_clos/1e4:.1f} 万卡")
print(f"多轨道拓扑规模 ≈ {cluster_rail/1e4:.0f} 万卡")
# 单超节点可用度
availability = 0.998
downtime_hours_per_year = (1 - availability) * 24 * 365
print(f"单超节点年中断 ≈ {downtime_hours_per_year:.1f} 小时")
把多台物理机器"变成一台逻辑计算机",正是超节点架构对抗通信开销与故障率的核心思路,也是十万亿参数模型有效训练的 prerequisit。
6. 生态层:从"可用"到"易用"的拐点
| 指标 | 数值 | 来源 |
|---|---|---|
| CANN 社区外部开发者占比 | 61%(首次超内部) | 腾讯研究院速递 |
| 鲲鹏生态全球开发者 | 超 416 万 | 腾讯研究院速递 |
| 已交付超节点 | 1000+ 套 | 头条 |
| 覆盖客户 | 370+ 家 | 头条 |
| Atlas 950 超节点 | 已进入规模商用 | 头条 |
汪涛称 CANN 已全面开源开放、进入常态化社区运营,昇腾生态跨越从"可用"迈向"易用"的关键拐点,支持主流大模型在昇腾平台原生训练。
7. 意义:国产算力的系统级替代
- 架构独立性:NPO + 灵衢给出不同于 NVLink/InfiniBand 的规模化路线,降低对单一海外互联方案的依赖。
- 十万亿级支撑:单超节点 1 PB HBM 与百万卡扩展能力,直接面向下一代超大模型训练/推理。
- 可靠性即算力:99.8% 可用度与功耗下降,把"省下的电费与中断时间"转化为有效算力。
- 生态正循环:外部开发者过半 + 千套交付,意味着软件栈与国产模型适配进入自增强阶段。
8. 常见问题(FAQ)
Q1:昇腾 960 单卡算力相比上代提升多少?
A:官方称性能"翻倍",960DT 提供 2 PFLOPS FP8 / 4 PFLOPS FP4,960PR 推理 FP4 达 8 PFLOPS;且上市时间较原计划提前 1–3 个季度。
Q2:NPO 和传统的可插拔光模块有什么不同?
A:NPO 把光学引擎靠近芯片封装,缩短电信号路径,降低功耗与延迟;Hi-ONE 单引擎 7.2T、内置光源,5500 个即可替代 4.8 万颗 800G 模块,省电超 550 千瓦。
Q3:百万卡集群怎么实现?
A:基于灵衢 UnifiedBus 统一协议,先用二层 CLOS 四平面组网到 51.2 万卡,再叠加多轨道拓扑技术扩展到 100 万卡昇腾超节点集群。
Q4:和 NVLink/InfiniBand 路线有何区别?
A:昇腾走"超节点 + 灵衢统一总线 + NPO 光互联"的系统架构路线,强调把数千芯当一台逻辑机器;NV 系依赖 NVLink 域与 InfiniBand 横向扩展,两者在拓扑与协议栈上并行存在。
Q5:开发者现在能用吗?
A:芯片 2027 年起就绪,但 CANN 已开源、Atlas 950 超节点规模商用,现有生态可先基于上一代平台开发适配。
Q6:对国产大模型训练意味着什么?
A:更强的单超节点 HBM 与互联,叠加百万卡扩展,意味着十万亿参数模型的国产原生训练具备更完整的底座支撑。
9. 参考资料
- 华为全联接大会 2026 主题演讲(汪涛),上海,2026-09-17
- 网易:《全球首个采用 NPO 技术 华为轮值董事长汪涛:昇腾 960 芯片将提前发布,并实现性能翻番》,2026-09-17
- 今日头条:《昇腾 960 提前就绪:华为全联接大会释放算力产业重塑信号》,2026-09-18
- 今日头条:《华为昇腾 960 超节点亮相,NPO 光互联带来新变化》,2026-09-18
- 腾讯研究院 AI 速递 20260918
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐



所有评论(0)