昇腾芯片演进史:从 910B 到 960 的代际跨越

昇腾深度学习技术系列 · 第 3 篇 / 共 20 篇

上一篇:达芬奇架构深度解析

下一篇:CANN 异构计算架构:五层分层设计全解

一、引言:昇腾芯片的演进逻辑

2018 年,华为发布 Ascend 310,切入边缘推理场景;2019 年,Ascend 910 横空出世,成为首款面向云端训练的智能芯片。从那一刻起,昇腾芯片走上了一条在全球 AI 芯片领域几乎无人能及的快速迭代路线—— “一年一代、算力翻倍” 。

回头看这条演进路线,每一代昇腾芯片都有一个标志性的技术突破:

代际年份标志性突破
910B2023单 die 成熟版,arch22 架构定型
910C2025双 die 合封,不改架构提升算力
9502026第三代达芬奇核心 + 自研 HBM + 一芯双构
9602027NPO 光互连,全球首个近封装光学超节点

核心驱动力很明确:大模型参数规模的爆发式增长。从百亿参数(BERT 时代)到千亿参数(GPT-3 级别),再到万亿参数(MoE 架构),每一轮模型膨胀都对芯片的算力、内存、互联提出翻倍要求。昇腾芯片的代际演进,本质上就是在追赶这场"参数爆炸"。

在上一篇中,我们深入拆解了达芬奇架构的内部设计——AI Core 的三大计算单元、存储层次、以及从 arch22 到 arch35 的架构演进。这一篇,我们站在更高的视角,从芯片和系统层面完整梳理昇腾芯片的代际演进路线,看懂每一代的核心技术突破、设计取舍以及行业意义。

二、昇腾芯片完整演进时间线

2018 ────── Ascend 310(边缘推理芯片,功耗仅 8W)

2019 ────── Ascend 910(首款云端训练芯片,对标 Tesla V100)

│ ╔═══════════════════════════════════════╗
│ ║ 疫情期间的沉淀期(2020-2022) ║
│ ║ 软件栈打磨、生态建设、架构迭代 ║
│ ╚═══════════════════════════════════════╝

2023 ────── Ascend 910B(Atlas A2,单 die 成熟版)

2025 Q1 ─── Ascend 910C(Atlas A3,双 die 合封)

2026 Q1 ─── Ascend 950PR(Atlas A5,自研 HBM,SIMD+SIMT)

2026 Q4 ─── Ascend 950DT(HiZQ 2.0 朱雀内存,训练/Decode 场景)

2027 Q1 ─── Ascend 960DT(NPO 超节点,性能翻番)

2027 Q3 ─── Ascend 960PR

2028 ────── Ascend 970(算力再翻倍)

2029 ────── Ascend 980

从这张时间线可以看到几个关键信息:

  1. 2018-2019 年是起步期,310 和 910 分别覆盖推理和训练;
  2. 2020-2022 年是沉淀期,公开信息较少,但软件栈(CANN、MindSpore)在这三年里进行了大量打磨;
  3. 2023 年之后进入"一年一代"的高速迭代期,从 910B 到 980,六代芯片在七年内密集发布;
  4. 950 系列是架构分水岭,从 arch22 跃迁到 arch35,编程模型从纯 SIMD 变为 SIMD+SIMT。

三、Ascend 910B:成熟的起点(Atlas A2)

3.1 关键规格

参数规格
架构arch22(第二代达芬奇核心)
核心设计分离架构(AIC + AIV)
计算核心24 AIC + 48 AIV
FP16 算力~350 TFLOPS
INT8 算力~640 TOPS
内存64GB HBM2E
内存带宽~1.2-1.6 TB/s
互联带宽~784 GB/s(HCCS)
工艺7nm
主频1.8 GHz
L0C Cache128 KB
Unified Buffer192 KB
L2 Cache192 MB
FP8/MXFP4不支持

3.2 设计特点与历史定位

910B 是 Ascend 910 的成熟改进版,采用单 die 设计,架构上沿用 arch22(第二代达芬奇核心)。它的设计哲学是"稳"——在已验证的架构上做工程优化,提升良率、降低功耗、完善软件栈。

对标分析:910B 的 FP16 算力约 350 TFLOPS,相比 NVIDIA A100 的 312 TFLOPS(FP16 Tensor Core)略有优势。在 INT8 推理场景下,640 TOPS 的算力也能与 A100 正面竞争。这让 910B 成为早期昇腾生态中部署量最大的芯片。

明显短板:不支持 FP8。NVIDIA H100 已经支持 FP8 Tensor Core,B200 更是将 FP8 作为默认训练精度。FP8 的缺失意味着 910B 在新一代大模型训练中,无法享受低精度带来的算力翻倍红利。这是一个架构层面的限制,不是软件能补的。

历史意义:910B 证明了华为有能力设计并量产一款可商用的云端训练芯片,为后续的 910C 和 950 积累了宝贵的工程经验和生态基础。

四、Ascend 910C:双 die 封装的工程创新(Atlas A3

4.1 关键规格

参数规格
架构arch22(与 910B 完全相同)
核心设计双 910B die 合封(一个封装内两个计算 die)
FP16 算力~780-800 TFLOPS
内存128 GB
内存带宽~3.2 TB/s
互联带宽784 GB/s
工艺SMIC N+2
功耗~250W

4.2 最重要的认知:A3 不是新架构!

这一点怎么强调都不为过:Ascend 910C 的 NPU 架构仍然是 arch22。NPU_ARCH 的值仍为 2201,编译路径与 A2 完全相同(BUILD_MODE=c220,arch22)。换句话说,910C 不是"新一代芯片",而是"同一架构的封装级算力扩展"。

这是一个非常务实的工程决策:

  • 在 arch22 架构已经成熟、软件栈完善的前提下,重新设计一代架构需要 2-3 年;
  • 但市场对算力的需求是即时的,不可能等 3 年;
  • 双 die 合封是一条"快车道"——不改架构、不改编译路径,通过封装级创新实现算力翻倍。

4.3 双 die 封装的技术挑战

把两个计算 die 封装在一起,绝非简单的"1+1"。需要解决的核心问题包括:

  1. Die 间通信延迟:两个 die 之间的数据通路带宽和延迟直接影响并行效率;
  2. 功耗与散热:250W 的 TDP 对散热方案提出更高要求;
  3. 软件透明性:上层应用和算子不需要感知双 die 的存在,编译器自动完成 task 分配。

910C 的 soc_version 有多个后缀(如 9391/9392/9381/9382/9372/9362),这些是 silicon bin 的标识,运行时解析,开发者严禁硬编码。不同 bin 对应不同的体质(频率上限、良率分级),运行时动态适配。

4.4 性能定位与部署现状

910C 的 FP16 算力约为 NVIDIA H100 的 60-70%。虽然单卡性能不及 H100,但配合 CloudMatrix 384 超节点(384 卡全互联拓扑),系统级算力已经可以满足千亿参数模型的训练需求。截至 2025 年,Atlas A3(910C)已部署超过 1000 套,是国内大规模 AI 集群的主力之一。

五、Ascend 950 系列:一芯双构的场景化革命(Atlas A5)

如果说 910B 是"成熟的起点",910C 是"务实的过渡",那么 950 系列就是昇腾芯片历史上最大的一次架构跃迁。

5.1 核心突破

950 系列带来了五项根本性变化:

突破点说明
第三代达芬奇核心NPU_ARCH = 3510,架构代号 arch35
双编程模型SIMD + SIMT,首次支持类 GPU 编程范式
低精度数据格式首次支持 FP8 / MXFP8 / MXFP4 / HiF8
自研 HBM摆脱对外部 HBM 供应商(三星/SK 海力士)的依赖
内存访问颗粒度从 512B 降至 128B,更适合细粒度访存

从 arch22 到 arch35,不只是数字的变化。arch35 引入了 SIMT 编程模型,意味着开发者可以用类似 CUDA 的线程模型来编写算子,大幅降低了从 NVIDIA 平台迁移的门槛。同时,SIMD 路径仍然保留,确保已有的 TBE 算子可以平滑迁移。

5.2 “一芯双构”——昇腾的独创设计

950 系列最引人注目的设计是"一芯双构":共用同一个 Ascend 950 核心 Die,搭配不同的自研 HBM,分化为两个型号。

规格950PR950DT
定位Prefill + 推荐场景Decode + 训练场景
HBM 型号HiBL 1.0(低成本)HiZQ 2.0 朱雀(高带宽)
内存容量128 GB144 GB
内存带宽1.6 TB/s4 TB/s
Cube FP8865 TFLOPS865 TFLOPS
Cube MXFP41730 TFLOPS1730 TFLOPS
Cube BF16/FP16432 TFLOPS432 TFLOPS
Vector FP1654 TFLOPS54 TFLOPS
计算核心32 AIC + 64 AIV32 AIC + 64 AIV(满 die)
互联带宽2 TB/s(灵衢 2.0)2 TB/s
L2 Cache128 MB128 MB
PCIe5.0 x16, 128 GB/s5.0 x16, 128 GB/s
量产时间2026 Q12026 Q4

为什么要一芯双构?

这要从大模型推理的两个阶段说起:

  • Prefill 阶段(首 token 生成):一次性处理整个 prompt,是计算密集型任务,核心瓶颈是 Cube
    算力,对内存带宽要求相对宽松。用低成本 HiBL HBM 就够了。
  • Decode 阶段(逐 token 生成):每个 token 的生成都需要读取完整的 KV Cache,是带宽密集型任务,核心瓶颈是
    HBM 带宽。必须用 4 TB/s 的 HiZQ 2.0 朱雀

如果统一用高带宽 HBM,Prefill 场景就会为用不满的带宽多花钱;如果统一用低成本 HBM,Decode 场景就会受限于带宽瓶颈。一芯双构的本质是让每一分钱都花在刀刃上

这种设计类似于 NVIDIA 的 H100/H200 区分(不同 HBM 容量),但昇腾做得更精细——不仅容量不同,带宽规格也完全不同,是真正意义上的"场景化定制"。

5.3 自研 HBM 的战略意义

自研 HBM 可能是 950 系列最被低估的突破。

全球 HBM 市场长期被三星、SK 海力士、美光三家垄断。在供应链紧张的时期,HBM 的交期长达 6-12 个月,价格持续上涨。对华为而言,这意味着:

  1. 供应链风险:随时可能面临断供或限供;
  2. 成本不可控:HBM 占 AI 芯片 BOM 成本的 30-40%;
  3. 定制化受限:无法根据昇腾架构的需求定制 HBM 接口。

华为的自研方案分两条线:

  • HiBL 1.0:低成本 HBM,面向 Prefill 场景,大幅降低单位算力的投资成本;
  • HiZQ 2.0(朱雀) :高带宽 HBM,4 TB/s,144 GB,面向 Decode 和训练场景。

这不仅填补了国内 HBM 技术的空白,更重要的是让昇腾芯片的内存子系统可以与核心架构深度协同优化——这是外购 HBM 永远做不到的。

5.4 三代芯片全面对比

维度910B(A2)910C(A3)950PR/DT(A5)
架构arch22arch22arch35
编程模型SIMD onlySIMD onlySIMD + SIMT
核心设计单 die双 die 合封新一代核心 die
AIC / AIV24 / 4824 / 48 × 232 / 64
FP16 算力~350T~800T432T
FP8 算力❌ 不支持❌ 不支持865T
MXFP4 算力❌ 不支持❌ 不支持1730T
内存容量64 GB128 GB128 / 144 GB
内存带宽~1.4 TB/s3.2 TB/s1.6 / 4 TB/s
互联带宽784 GB/s784 GB/s2 TB/s
HBM 来源外购 HBM2E外购 HBM自研 HiBL / HiZQ
内存访问颗粒度512 B512 B128 B

注意 950 的 FP16 算力(432T)反而低于 910C(800T),这不是退步——而是因为 FP16 算力不再是核心指标。950 的 FP8 算力(865T)和 MXFP4 算力(1730T)才是真正的杀手锏。低精度计算时代,用 FP16 来比较芯片算力,就像用单核主频来比较 CPU——已经过时了。

六、Ascend 960:NPO 光互连的里程碑

6.1 发布背景

2026 年 9 月 17 日,华为全联接大会 2026 上,Ascend 960 系列正式发布。华为透露,芯片研发进度超出预期——960DT 预计 2027 Q1 就绪(比原计划提前 3 个季度),960PR 预计 2027 Q3 就绪(比原计划提前 1 个季度)。

6.2 核心规格

参数Ascend 960
FP8 算力2 PFLOPS
FP4 算力4 PFLOPS
内存容量288 GB
内存带宽9.6 TB/s
互联带宽2.2 TB/s
数据格式支持 HiF4(业界最优 4bit 精度实现)
960DT 就绪2027 Q1
960PR 就绪2027 Q3

相比 950 系列,960 的 FP8 算力翻倍(2 PFLOPS vs 1 PFLOPS),内存容量从 128/144 GB 提升至 288 GB,内存带宽达到 9.6 TB/s。

6.3 960 超节点——全球首个 NPO 超节点

960 系列最大的看点不在芯片本身,而在系统级创新:全球首个 NPO(Near-Package Optics,近封装光学)超节点。

超节点参数数值
卡规模4096 卡 / 超节点
FP8 总算力8 EFLOPS
FP4 总算力16 EFLOPS
总 HBM1 PB
NPO 光引擎5500 个 Hi-ONE
替代光模块4.8 万颗 800G 光模块
支撑能力10 万亿参数大模型训练与推理

6.4 NPO 技术解读

传统数据中心的互连方式是"电→光→电"转换:芯片发出电信号,经过 PCB 走线到光模块,光模块完成电光转换后通过光纤传输,接收端再做一次光电转换。每一次转换都带来延迟和功耗开销,光模块本身也是数据中心故障率最高的组件之一。

NPO 的核心思想:将光引擎直接封装在芯片封装附近,实现"电→光"的零距离转换。电信号离开芯片后几乎立刻被转换为光信号,省去了 PCB 走线和传统光模块的中间环节。

华为自研的 NPO 光引擎 Hi-ONE 是业界首个量产 NPO 产品:

  • 总容量 7.2T
  • 唯一实现内置光源的 NPO 产品(内置光源意味着不需要外部激光器,降低了光引擎的复杂度和成本)
  • 正交架构 + 全液冷设计

用 5500 个 Hi-ONE 替代 4.8 万颗 800G 光模块,不只是成本和功耗的优化——更意味着互连可靠性的数量级提升。光模块减少了近 90%,故障点也相应减少了 90%。对于需要连续运行数周的大模型训练任务来说,这意味着更少的中断和更高的有效算力利用率。

七、未来路线图:970 与 980

芯片时间FP8 算力FP4 算力内存内存带宽互联带宽
950 系列20261 PFLOPS2 PFLOPS128/144 GB1.6/4 TB/s2 TB/s
96020272 PFLOPS4 PFLOPS288 GB9.6 TB/s2.2 TB/s
97020284 PFLOPS8 PFLOPS288 GB14.4 TB/s4 TB/s
9802029TBDTBDTBDTBDTBD

核心演进规律非常清晰:

  1. 每代算力翻倍:FP8 从 1P → 2P → 4P,严格遵循 τ 定律(华为版的"摩尔定律");
  2. 内存容量逐步加倍:从 128 GB 到 288 GB,未来有望达到 576 GB;
  3. 内存带宽翻两番:从 4 TB/s 到 9.6 TB/s 再到 14.4 TB/s;
  4. 互联带宽持续提升:从 2 TB/s 到 4 TB/s,NPO 光互连将持续升级。

到 2028 年的 Ascend 970,FP8 算力将达到 4 PFLOPS,FP4 达到 8 PFLOPS。按此推算,单个 4096 卡超节点的 FP8 总算力将达到 16 EFLOPS,足以支撑数十万亿参数模型的训练。

八、技术演进的深层逻辑

8.1 三条演进主线

昇腾芯片的代际演进,可以归纳为三条主线:

主线一:算力维度——低精度化

从 FP16(910B)→ FP8(950)→ FP4/HiF4(960),每一代都在推动更低精度的计算。这不是"偷工减料",而是大模型的特性决定的——研究表明,在合理的量化策略下,低精度训练的模型精度与全精度几乎无差异,但算力可以翻倍甚至翻四倍。

主线二:存储维度——自主可控 + 场景化

从外购 HBM(910B/910C)→ 自研 HBM(950 系列),从统一规格 → 一芯双构(PR/DT 分离)。存储子系统的自主化,是昇腾芯片在供应链安全和技术创新两个维度上的双重保障。

主线三:互联维度——从电到光

从 HCCS 电互连(910B/910C)→ 灵衢 2.0(950)→ NPO 光互连(960)。互联技术的演进,本质上是在解决"算力孤岛"问题——单卡算力再强,如果卡间通信跟不上,也无法组建高效的训练集群。NPO 技术从物理层面突破了电互连的带宽和功耗天花板。

8.2 与 NVIDIA 的演进路径对比

维度NVIDIA华为昇腾
迭代节奏~2 年一代(A100→H100→B200)~1 年一代(950→960→970)
架构路线GPU 通用计算(CUDA 生态)NPU 特定域 → 类 GPU 通用化(arch35 引入 SIMT)
编程模型CUDA(统一,20 年积累)CANN(从 SIMD → SIMD+SIMT,正在降低迁移门槛)
内存策略外购 HBM(三星/SK 海力士/美光)自研 HBM(HiBL/HiZQ),自主可控
场景分化H100/H200(HBM 容量区分,计算核心相同)950PR/950DT(HBM 带宽和容量均不同,真正场景化)
互连创新NVLink / NVSwitch(电信号)灵衢 + NPO 光引擎 Hi-ONE(光电融合)

两个最值得关注的差异:

第一,迭代节奏。 NVIDIA 大约每 2 年推出一代新架构(Ampere→Hopper→Blackwell),华为则保持每年一代的节奏。这意味着华为单代的架构变化幅度小于 NVIDIA,但累计迭代速度更快。910C 的"双 die 不改架构"就是这个策略的体现——用工程创新填平架构代际之间的空档。

第二,内存自主化。 NVIDIA 完全依赖三星、SK 海力士和美光的 HBM,这意味着 NVIDIA 的内存子系统优化受限于供应商的产品规格。华为的自研 HBM 虽然初始性能和成熟度可能不及三星/SK 海力士的顶级产品,但可以针对昇腾架构做深度定制——例如 128B 的内存访问颗粒度,就是为昇腾 Cube 单元的数据块大小量身设计的。

8.3 "一年一代"背后的工程挑战

保持"一年一代"的节奏,绝非易事。背后的挑战包括:

  1. 芯片设计效率:每次流片的成本高达数千万美元,设计周期必须压缩到 12 个月以内。这要求极高的 IP 复用率和自动化设计工具链支撑。
  2. 验证流程:AI 芯片的功能验证和性能验证极其复杂,需要在仿真、FPGA 原型验证、流片后验证三个阶段都保持高度效率。
  3. 软件栈同步迭代:每一代新芯片都需要 CANN、TorchNPU、MindSpore 等软件栈的同步适配。硬件快而软件慢,是 AI
    芯片公司最常遇到的问题。
  4. 生态兼容性:已有算子、模型、训练框架需要在新芯片上无缝运行。arch22 → arch35 的架构跃迁,CANN
    提供了自动迁移工具,但迁移质量仍需要大量验证。
  5. 自研 HBM 的良率与量产:HBM 是三维堆叠结构(TSV 硅通孔),制造难度极高。自研 HBM 的良率爬坡是 950
    量产的关键瓶颈之一。

九、总结

回顾昇腾芯片的演进历程,四个核心结论:

第一,从"跟随者"走向"创新者"。 910B 对标 A100,910C 对标 H100(约 60-70% 性能),这个阶段昇腾是在"追赶"。但到了 950 系列,“一芯双构"的场景化设计和自研 HBM 的引入,标志着昇腾开始在特定方向上"引领”——这种 Prefill/Decode 分离的设计理念,可能会影响整个行业的产品策略。

第二,自研 HBM 和 NPO 光互连是两大战略性突破。 前者解决了供应链安全和深度定制的问题,后者突破了系统级互连的带宽天花板。这两项技术不是渐进式改进,而是从根本上改变了昇腾芯片的技术底座。

第三,"一年一代"的节奏在全球 AI 芯片中属于最激进。 考虑到制裁环境下的供应链约束,能保持这个迭代速度,体现了华为在芯片设计、封装、HBM、互连等多个技术方向上的系统性投入。

第四,从 arch22 到 arch35 的架构跃迁,标志着昇腾从"专用 NPU"走向"通用 AI 计算平台"。 SIMT 编程模型的引入,大幅降低了 NVIDIA 开发者的迁移成本。这不是简单的"抄 CUDA",而是在保留 NPU 能效优势的同时,吸收了 GPU 的编程便利性——一条"第三条道路"。

昇腾芯片的故事,本质上是一家企业在极端约束条件下,如何通过系统性创新实现技术追赶和超越的故事。从 910B 的"跟随",到 910C 的"工程创新",到 950 的"架构突破",再到 960 的"系统级引领",每一步都有清晰的技术逻辑和战略考量。

而这场竞赛,还远未结束。

下一篇预告

第 4 篇:CANN 异构计算架构:五层分层设计全解

芯片再强,也需要软件栈来释放算力。下一篇,我们深入解析 CANN(Compute Architecture for Neural Networks)的五层分层架构:

AscendCL:统一的应用编程接口,如何屏蔽底层硬件差异
GraphCompiler:计算图编译器,如何把 Python 模型变成 NPU 上高效运行的机器码
TBE(Tensor Boost Engine):自定义算子开发框架,SIMD 编程的入口
Runtime:运行时管理,如何实现多核、多卡的 task 调度
HCCL(Huawei Collective Communication Library):分布式通信库,如何实现千卡高效协同

以及 CANN 开源社区的运作模式,和开发者如何参与生态建设。

敬请期待。

本文是「昇腾深度学习技术系列」第 3 篇。系列覆盖从芯片架构到框架、从算子开发到集群训练的完整知识体系,共 20 篇,持续更新中。

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐