WAIC 2026华为昇腾950超节点全维度解析:国产超节点的架构创新与BOM成本拆解

作者注:本文所有技术参数均来自 WAIC2026 华为昇腾技术分论坛公开披露信息,作者基于 20 年 ICT 软硬件架构经验做技术拆解,内容仅供学习研究参考。

一、超节点时代:AI 算力竞争从单卡性能转向系统能力

2026 年被行业普遍定义为 “国产千卡级超节点商用元年”。7 月上海 WAIC 大会上,华为 Atlas 950 SuperPoD 昇腾液冷超节点获得展会最高奖 SAIL 奖,成为今年算力领域最受关注的产品。这一结果可谓众望所归,也是 AI 产业需求变化带来的算力架构迭代的直接反映。当 2 万亿参数 MoE 大模型、百万上下文智能体应用从实验室走向规模落地,传统分布式服务器集群的架构短板已经成为算力效率提升的核心瓶颈。

图1:WAIC 2026华为昇腾950超节点

据 WAIC2026《超节点定义与实践白皮书》披露的行业实测数据,某头部大模型厂商用上一代384 卡集群训练 2 万亿参数 MoE 模型时,通信等待时间占总训练周期的 65%,直接导致模型上线时间拉长 40%。所以,从硬件落地的实际场景看,传统分布式集群采用 “单服务器 + 通用交换机” 的堆叠架构,跨节点数据拷贝带来的通信损耗占比太高,导致集群算力实际有效利用率低下,已经无法满足万亿模型训练中高频 All2All 通信、全局内存共享的需求。在此背景下,通过高速互联将数百 / 数千张加速卡逻辑整合为单一计算资源池、实现全局内存共享的超节点架构,成为全行业公认的下一代 AI 算力基础设施新形态。

与此同时,政策与市场双重因素进一步推动超节点赛道快速增长。据国家发改委 2026 年 6 月公开信息,东数西算二期工程新增总算力规模超过 10EFLOPS,其中训练算力占比 60%,直接对应数千个千卡级超节点的建设需求;据第三方券商 2026 年 7 月发布的算力产业报告测算,2026-2028 年国内标准化超节点市场复合增速将保持高位,到 2028 年市场规模有望突破 3000 亿元。需求端主要来自三个核心方向:一是东数西算二期工程进入交付期,各省级智算中心从 “建得上” 转向 “用得好”,对高利用率算力集群的需求集中释放;二是信创领域的自主可控要求持续深化,金融、能源、政务等关键行业算力采购的国产化比例稳步提升;三是头部大模型厂商、算力租赁企业的万卡级集群扩容计划将在 2026 年下半年逐步落地。

从下游应用需求的结构来看,超节点已经形成清晰的场景分层:头部大模型厂商的万亿参数训练任务是千卡级超节点的核心刚需,此前国产 384 卡以下的小规模集群已经无法满足其通信效率要求;三大运营商、省级智算中心作为采购主力,占整体市场需求的 45%,更偏好标准化、低 TCO 的液冷超节点产品,兼顾当前训练需求与未来弹性扩展;而算力租赁企业则以单位算力成本、集群开机率为核心指标,优先选择开放生态、易运维的超节点方案;而科研、工业仿真、自动驾驶训练等垂直场景目前仍以 512 卡以下的中小规模集群为主,8192 卡以上的极限扩展配置仅面向国家级超算、大科学装置等定制化场景。

受全球算力供应链大环境的影响,以英伟达为代表的海外高端超节点产品在国内市场的交付周期拉长至 12-16 周,采购成本较 2025 年上涨 30% 以上,且存在长期供应不确定性;而此前国产超节点产品多集中在 384 卡及以下规模,无法满足大模型训练的集群效率要求,因此,市场存在明确的千卡级标准化产品供给空白,昇腾 950 超节点正是在这一产业背景下推出的标准化千卡级超节点产品。

二、昇腾950技术架构解析:全栈自研的开放超节点方案

昇腾 950 超节点是华为昇腾系列第三代集群产品,据 WAIC2026 华为官方发布会现场公布信息,其标准商用单元为 1024 卡配置,最大可线性扩展至 8192 卡,是目前国内公开的、可规模交付的最大单集群国产训练方案。

核心技术特性

昇腾 950 超节点的核心创新主要体现在三个维度:高效通信、全局共享和工程落地。

第一,原生全局统一内存架构,是其区别于传统集群的核心特性和重大创新。在 1024 卡标准配置下,昇腾 950 通过自研互联协议实现 256TB 跨物理节点全局统一内存编址,所有加速卡可以直接访问集群内任意位置的内存数据,无需反复跨节点拷贝,从架构层面解决了传统集群通信损耗高的痛点。据官方实测数据,集群有效算力利用率可达 82%-85%,较传统分布式集群提升一倍以上,完美适配 MoE 模型训练、大模型推理 KV Cache 共享等核心场景。 即便单卡峰值算力与海外顶尖产品存在差距,但华为昇腾950通过更高的集群利用率可以大幅缩小实际有效算力的差距。

第二,采用自研灵衢 2.0 全光互联协议。标准配置下集群端到端通信 RTT 时延为 3μs,单跳通信时延低至 200ns,单向互联带宽达 2TB/s,较上一代互联方案带宽提升 15 倍。与传统 IB 网络需要经过多层交换机转发不同,灵衢 2.0 采用全光交换架构,数据直通不需要协议转换,单跳时延比传统 IB 网络低 70%。与海外厂商封闭的私有互联协议不同,华为在 WAIC 现场宣布灵衢 2.0 协议完全对外开放,目前已有十余家国产硬件厂商完成协议适配,覆盖光模块、交换机、服务器整机等产业链环节,旨在构建开放的超节点技术生态。

第三,全液冷高密度工程设计,适配新建智算中心需求。单柜支持 64 卡盲插,采用全浸没式液冷方案,集群 PUE 可低至 1.08,大幅降低长期运维的电力成本;配套 CANN 8.0 统一调度软件栈,目前已经完成 PyTorch、MindSpore、Paddle等主流框架的原生适配,支持 95% 以上的主流大模型算子,算子平均性能较上一代提升 40%,降低客户的使用门槛。

在商业化落地基础方面,上一代昇腾 384 卡集群截至 2026 年 7 月已累计交付数百套,覆盖互联网、金融、制造、能源等多个行业,为新一代950 超节点的规模化交付积累了工程落地经验。2026WAIC 现场,华为与中国移动签订了首笔昇腾 950 超节点商用合同,将用于建设 3EFLOPS 规模的省级智算中心,预计 2027 年正式上线。根据官方公布的节奏,昇腾 950 超节点将于 2026 年第四季度启动批量交付,产能优先保障已签订长周期协议的重点客户项目。

图2:华为昇腾950超节点技术架构

但是,从工程角度客观来看,昇腾 950 目前仍存在明确的应用边界:其一,部署门槛较高,单卡功耗 600W,1024 卡集群整体 IT 负载超过 6MW,对机房高压供电、液冷配套、楼层承重要求严苛,传统风冷数据中心无法直接改造部署,仅适配新建的大型标准化智算中心;其二,生态适配仍在完善中,目前 CANN 软件栈已覆盖主流大模型训练与通用行业场景,但工业仿真、垂直领域专业软件等场景的原生适配仍需产业链共同推进;其三,8192 卡极限配置的整体投入超过 12 亿元,仅适合特定超算场景,商业市场主流需求仍集中在 1024 卡标准单元。

行业竞争格局

2026 WAIC 展会上,国内外主流算力厂商均发布了超节点相关产品,多数国内厂商的集群级详细参数尚未公开,本文基于各厂商官方发布的公开信息做个对比。

表 1:主流超节点公开参数对比

产品名称

标准单元卡数

最大线性扩展卡数

标准单元 FP8 总算力

标准单元全局统一内存

集群端到端通信时延

生态属性

2026 年交付状态

华为昇腾 950 SuperPoD

1024

8192

1EFLOPS

256TB 自研HBM

3μs

灵衢开放生态

2026Q4 批量交付

英伟达 GB300 NVL72

72

576

0.7EFLOPS

20.7TB HBM3e

2.5μs

CUDA 封闭生态

交付周期 12-16 周

英伟达 Rubin200 NVL144

144

1152

1.1EFLOPS(设计值)

72TB HBM4

1.8μs(设计值)

CUDA 封闭生态

2027Q2 量产

阿里云磐久 AL128

128

1024

未公开

未公开

未公开

阿里云自有生态

128 卡样机展示,2026Q4 小批量交付

沐曦曦景 S600

64

320

未公开

未公开

未公开

开放生态

320 卡规模已商用交付

壁仞 BR 系列光互联超节点

128

1024

未公开

未公开

未公开

开放生态

128 卡原理样机展示,2027Q1 批量交付

中兴 OEX Matrix 超节点

64

512

未公开

未公开

未公开

开放生态

512 卡规模已商用交付

从竞争格局看,海外厂商产品在单卡峰值性能、通用软件生态成熟度上仍有优势,但受供应链与合规因素影响,在国内信创市场应用受限;而国内厂商目前多数聚焦在 64-512 卡中小规模超节点场景,千卡级标准化产品仍在商用落地过程中,华为昇腾 950 是目前国内公开的、具备明确批量交付时间的千卡级全栈自研超节点产品,在商用进度上处于行业第一梯队。整体来看,超节点时代的竞争已经从单纯的单卡性能比拼,转向系统互联效率、软件生态、全生命周期成本、交付能力的综合竞争,不同厂商的架构设计各有侧重,将在不同细分场景形成差异化竞争。

三、产业生态与商业价值拆解

全产业链协同发展

昇腾 950 超节点的全栈自研特性,将带动从上游硬件制造到下游应用落地的完整国产算力产业链协同:上游环节,芯片制造、液冷设备、高速光模块、连接器、PCB、供电系统等核心部件已基本具备国产供应能力。据 2026 WAIC 现场公开合作信息,英维克、申菱环境为 950 超节点提供液冷配套,光迅科技、中际旭创供应 800G 硅光模块,深南电路、沪电股份供应高多层服务器 PCB。中游环节,华为已构建从芯片算子库、大模型训练框架到集群调度软件的完整技术栈,目前已有数百家软件厂商完成 CANN 适配,覆盖主流大模型与行业场景;下游环节,华为与三大运营商、数十个省级智算中心、上百家行业解决方案商建立了合作,可提供从集群建设到应用落地的全流程服务,降低客户的使用门槛。

硬件成本与 TCO 优势

本文以 1024 卡标准配置的昇腾 950 超节点为测算对象,基于互联网公开报价信息、相关网站的硬件现货行情以及经验数据进行成本估算(仅供参考,不代表厂商官方数据)

表 2:1024 卡昇腾 950 超节点硬件成本拆分

成本构成

占比

测算说明

昇腾 950DT芯片 GPU卡

约 55%

单卡以均价8 万元估算,1024 卡合计约 8200 万元

高速互联与交换设备

约 18%

约 2700 万元,包含 800G 硅光模块、灵衢交换板、高速线缆等

液冷机柜与供电散热系统

约 15%

约 2250 万元,包含 160 个液冷机柜、高压供电、浸没式液冷配套(单柜配套约 14 万元)

整机集成与现场部署

约 6%

约 900 万元,包含工厂预集成、现场安装、布线调试等

软件授权与基础运维

约 6%

约 900 万元,包含 CANN 商业授权、3 年基础运维服务

合计

100%

单集群硬件总成本约 1.5 亿元,单位 FP8 算力成本约 15 元 / TFLOPS

从成本结构看,NPU 芯片仍是超节点成本的核心组成部分,高速互联与液冷系统合计占比超过 33%,是未来产业降本的核心方向。据中国信通院《算力光互联产业白皮书》2026 年预测,2027 年互联设备成本将下降25%,随着灵衢协议的普及与国产光模块产业链的成熟,由此带动超节点整体硬件成本将下降至少10%。

图3:1024卡超节点BOM成本占比(内部测算)

从 5 年全生命周期 TCO 角度,我们先看一组数据:

 (1)集群利用率:昇腾 950 官方公布典型值 82%,GB300 官方公布典型值 65%;

(2)  国内实际采购价(含所有税费、许可、渠道费):前文已估算昇腾 950 1024 卡集群整套成本 约1.5 亿(标称 1EFLOPS),而GB300 整柜(72 卡,标称 0.7EFLOPS)美区官方原价约 3200 万 / 柜,但出口管制下国内溢价约 2.8 倍,约9000 万;

 (3) PUE:昇腾 1.08(官方值),GB3001.12(官方值);

 (4) 软件费用:昇腾含 3 年授权,后 2 年升级费 18%/ 年;GB300 授权按年收取,2200 元 / 卡 / 年。

从这组数据来看,我们有理由相信,同等有效算力下,昇腾 950 集群与海外 GB300 集群相比,就国内用户来说,昇腾950方案整体 TCO 应该低于GB300方案,主要原因是昇腾950采用的是全国产方案,在硬件采购、本地化运维、长期服务成本上占据明显优势,这一点对于成本敏感的智算中心、算力租赁客户具备较强的吸引力。

商业化路径

昇腾超节点的商业价值不是单一的硬件销售,而是三层多元化收入结构:短期来看,硬件集群销售是核心收入来源,包括标准化产品直销、渠道分销、芯片供应给合作整机厂商等模式,保持合理的毛利水平;中期来看,CANN 商业授权、集群智能运维、大模型迁移适配等增值服务占比将逐步提升,这类业务毛利率更高,也能提升客户粘性;长期来看,灵衢生态认证、智算中心整体总包、算力云运营分成等模式将打开新的增长空间。

从客户结构看,政企、运营商、互联网、海外市场的需求特点不同,将形成差异化的产品与服务体系,目前昇腾 950 已经实现东南亚、拉美地区的小批量订单交付,海外市场成为新的增量空间。

四、落地约束与长期产业展望

短期落地的现实约束

作为一款 2026 年四季度才批量交付的新产品,昇腾 950 超节点的规模落地仍面临几方面现实约束:

一是机房配套的建设周期约束。千卡级液冷超节点对供电、制冷、楼层承重的要求远高于传统服务器,新建机房的适配周期需要 6-12 个月,短期内容易出现设备交付与机房建设节奏不匹配的问题;

二是生态完善需要时间。虽然主流大模型场景已经完成适配,但部分垂直行业的专业软件、小众开发框架的迁移仍需产业链共同推进,客户的使用习惯培养也需要周期;

三是市场竞争将逐步加剧。2027 年起,国内多家厂商的千卡级超节点产品将进入批量交付阶段,市场将从目前的供给不足转向多厂商竞争,产品价格、服务能力将成为核心竞争要素;

四是芯片产能仍存在爬坡过程。2026 年批量交付初期,产能受上游制造环节约束,难以完全满足全市场需求,重点长协项目将优先交付。

长期产业趋势

展望未来三年,国产超节点赛道将呈现三个明确的发展趋势:

第一,超节点将成为智算中心的标准配置。据2026 WAIC《超节点定义与实践白皮书》预测,到 2028 年,新建智算中心的训练算力基本上都会采用超节点架构,传统分布式集群将逐步退出训练市场,超节点整体渗透率将超过 70%;

第二,开放互联协议将成为行业主流。类似灵衢的开放高速互联标准将逐步取代传统封闭互联方案,带动整个国产算力产业链的技术进步与成本下降,形成开放协同的产业生态,避免出现单一厂商封闭垄断的局面;

第三,国产算力出海将进入加速期。凭借高性价比、快速交付、开放生态的优势,国产超节点将在东南亚、拉美、中东等新兴市场逐步替代海外中高端产品,成为中国硬科技出海的新赛道。

整体来看,昇腾 950 超节点的推出,标志着国产算力从 “单卡跟随” 进入 “系统创新” 的新阶段。尽管短期仍面临配套、生态、产能等现实约束,但在产业需求与自主可控的双重驱动下,以昇腾为代表的国产超节点方案将逐步成为国内算力基础设施的核心支撑,推动全球算力产业向更加开放、多元的方向发展。

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐