当大模型参数从千亿迈向十万亿,单卡性能早已不是瓶颈——真正卡脖子的是卡与卡之间的通信。华为在全联接大会2026上扔出的昇腾960超节点,用NPO光互联把4096张卡焊成一台"超级计算机",直接把集群通信开销从40%压到历史新低。这不是又一张PPT,而是已经部署了1000+套的工程现实。

一、热点切入:大模型训练,为什么越训越"贵"?

2026年9月,大模型赛道的热度只增不减。Meta的Muse Spark 1.3三天冲上榜首,OpenAI的GPT-6 Astra紧随其后,国产Kimi K3、GLM-5.3也杀入全球前十。榜单上的参数规模从千亿向十万亿狂奔,但榜单背后的工程团队却在经历一场静默的"算力焦虑"。

这不是耸人听闻。一个实际数字:在10万卡规模的训练集群中,传统服务器架构下集群内部通信占训练时间超过40%。也就是说,你花了千万级算力预算,有四成时间GPU在"等数据"。

问题的根源在于Transformer架构的大规模分布式训练需要频繁的AllReduce通信。当模型参数从70B扩展到万亿级,梯度同步的数据量呈指数增长,而传统集群中卡与卡之间通过PCIe交换机和InfiniBand网络互联,带宽有限、跳数多、延迟累积。结果就是——单卡算力在涨,集群有效算力却在跌

业界把这个问题叫做"Scale-out瓶颈"。简单说,你堆的卡越多,通信开销占比越大,边际收益越小。这不是某个厂商的问题,是整个行业的结构性痛点。

二、破局之道:超节点架构,把"集群"变成"一台机器"

华为给出的答案是超节点(Super Node)

核心思路并不复杂:通过高速互联协议将成百上千张算力卡"焊"在一起,实现跨物理服务器的内存统一编址与访问,让整个集群在逻辑上等效于一台巨型计算机。这样一来,卡间通信不再走传统网络协议栈,而是通过硬件级直连,延迟从微秒级降到纳秒级。

但思路简单,工程实现极难。华为在全联接大会2026上发布的昇腾960超节点,首次采用了NPO(近封装光学)技术,这是关键突破。

2.1 NPO光互联:用光替代电,把延迟打到底

传统超节点内部互联用的是电互联(铜线),信号在高速传输时面临严重的损耗和串扰问题,传输距离受限。NPO技术的核心创新是将光引擎直接封装在芯片附近,用光信号替代电信号进行高速互联。

华为自研的Hi-ONE光引擎是业界首个具备量产能力的NPO产品:

指标Hi-ONE NPO光引擎传统800G光模块
单引擎传输容量7.2T0.8T
内置光源✅ 是❌ 否
量产能力✅ 已量产已量产
单超节点所需数量5,500个~48,000颗

一个昇腾960超节点用5,500个Hi-ONE替代了原本需要的约48,000颗800G光模块,功耗降低超过550千瓦,系统无故障运行时间提升一倍,可用度达到99.8%。

2.2 算力规格:4096卡一体,8E FP8算力

昇腾960超节点的核心参数:

  • 最大支持4096卡互连(上一代1024卡,4倍提升)
  • 8 EFLOPS FP8算力(约800亿亿次/秒)
  • 1 PB HBM容量(1,048,576 GB显存池)
  • 芯片级:昇腾960单卡FP8算力2PFLOPS,HBM 288GB,访存带宽9.6TB/s,互联带宽2.2TB/s

这些数字意味着什么?一个超节点就能装下当前最大规模的大模型全部参数,且训练过程中无需跨网络节点搬运数据——所有梯度同步都在超节点内部通过内存语义互联完成。

2.3 集群扩展:从4096卡到100万卡

单个超节点还不够。多个昇腾960超节点通过灵衢网络或RoCE互联,采用二层CLOS四平面组网,最大集群规模可达51.2万卡。再叠加多轨道拓扑技术,最大可支持100万卡昇腾超节点集群。

华为马尔科夫实验室的仿真数据:采用4K超节点构成的10万卡集群,相比8卡服务器组成的同规模集群,模型浮点算力利用率(MFU)提升2.75倍

三、行业痛点 vs 方案价值:一张表看清差距

维度传统万卡集群昇腾960超节点方案改善幅度
卡间互联PCIe + IB网络NPO光互联 + 灵衢总线带宽提升数倍,延迟大幅降低
通信占比>40%训练时间大幅压缩MFU提升2.75倍
单节点规模8卡/台4096卡/节点512倍
功耗48,000颗光模块5,500个Hi-ONE降550kW+
可用度常规水平99.8%MTBF翻倍
集群扩展万卡级100万卡级100倍
生态开放封闭生态CANN全面开源外部开发者占比61%

四、对比分析:国产算力的差异化竞争力

4.1 vs NVIDIA H100/H200集群

NVIDIA的NVLink互联在单节点(8卡)内表现出色,但跨节点扩展仍依赖InfiniBand网络,超节点规模受限。华为的NPO技术将光互联推到芯片封装级别,单节点4096卡的规模是NVLink方案的单节点512倍。

更关键的是生态开放度。NVIDIA的CUDA生态虽然成熟但高度封闭,而华为选择CANN全面开源开放,昇腾已成为PyTorch官网首个可直装的国产平台,原生训练模型超40个,外部开发者占比61%。对于关注供应链安全的企业来说,这是一个不可忽视的维度。

4.2 vs 壁仞科技等国产超节点方案

壁仞科技也在推进NPO光互连超节点,BLink™2.0的内存语义互连和在网计算方案有其特色。但华为的优势在于全栈自研——从芯片(昇腾960)到光引擎(Hi-ONE)到互联总线(灵衢)到操作系统(欧拉)到AI框架(MindSpore/CANN),垂直整合深度无人能及。

这种全栈能力带来的直接好处是:优化可以跨层联动。比如KV Cache的存储优化,华为同步发布了OceanStor M900 AI记忆存储系统,提供L3.5层PB级KV缓存,通过灵衢UnifiedBus与昇腾超节点"一跳直连",推理场景下的首字延迟和吞吐量都有量级改善。

4.3 华为云的差异化:从卖算力到卖"任务完成能力"

这里要划重点。华为云不只是卖裸金属算力,而是构建了完整的Agentic Infra体系:

  • 底层:昇腾超节点 + 鲲鹏超节点 + OceanStor M900 KV缓存,通过灵衢UnifiedBus拉通
  • 中间层:Agentic MaaS平台汇聚160+主流大模型,免部署一键调用
  • 平台层:智果AgentArts企业级智能体平台,保障生产级长程任务成功率超80%
  • 行业层:"行业AI梦工厂"沉淀超1000个行业资产,落地项目超1000个

截至目前,华为云Agentic Infra已服务超过3500家客户,智果AgentArts及开源版openJiuwen已服务100多家企业。这不是PPT上的数字,是实打实的生产环境部署。

五、工程现实:不是PPT,是已部署的产线

一个容易被忽视的事实:昇腾910C超节点已累计部署超过1000套,昇腾950超节点已实现规模商用。昇腾960超节点是这一技术路线的第三代产品,不是第一代验证。

芯片路线图也明确:昇腾960DT将于2027年Q1就绪(较原计划提前三个季度),昇腾960PR将于2027年Q3就绪,未来保持一年一代演进,2028年和2029年陆续推出昇腾970、980。

DeepSeek计划部署至少16万颗华为AI加速器,采用昇腾950DT运行模型——这是国产算力获得头部大模型公司大规模采购的有力信号。

六、写在最后:算力基建的"华为时刻"

2026年,大模型竞争进入深水区。参数规模、推理成本、训练效率——每一个指标背后都是算力基础设施的硬实力比拼。

华为昇腾960超节点的发布,标志着国产算力在系统级工程能力上实现了从追赶到引领的跨越。NPO光互联、灵衢总线、全栈自研、CANN开源——这套组合拳打出的不是单点优势,而是系统级竞争力。

对于技术选型者而言,一个现实的问题值得思考:当你的大模型训练任务需要万卡级算力时,是继续忍受40%的通信浪费,还是选择一个已经部署了1000+套、MFU提升2.75倍的工程方案?

答案,或许已经在风中。


本文技术数据来源: 华为全联接大会2026官方发布、国盛证券/中财网/通信世界等行业研报、华为马尔科夫实验室仿真数据。文章站在技术从业者视角撰写,旨在提供选型参考,不构成商业推广。

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐