昇腾芯片演进史:从 910B 到 960 的代际跨越
昇腾芯片演进史:从 910B 到 960 的代际跨越
昇腾深度学习技术系列 · 第 3 篇 / 共 20 篇
上一篇:达芬奇架构深度解析
下一篇:CANN 异构计算架构:五层分层设计全解
一、引言:昇腾芯片的演进逻辑
2018 年,华为发布 Ascend 310,切入边缘推理场景;2019 年,Ascend 910 横空出世,成为首款面向云端训练的智能芯片。从那一刻起,昇腾芯片走上了一条在全球 AI 芯片领域几乎无人能及的快速迭代路线—— “一年一代、算力翻倍” 。
回头看这条演进路线,每一代昇腾芯片都有一个标志性的技术突破:
| 代际 | 年份 | 标志性突破 |
|---|---|---|
| 910B | 2023 | 单 die 成熟版,arch22 架构定型 |
| 910C | 2025 | 双 die 合封,不改架构提升算力 |
| 950 | 2026 | 第三代达芬奇核心 + 自研 HBM + 一芯双构 |
| 960 | 2027 | NPO 光互连,全球首个近封装光学超节点 |
核心驱动力很明确:大模型参数规模的爆发式增长。从百亿参数(BERT 时代)到千亿参数(GPT-3 级别),再到万亿参数(MoE 架构),每一轮模型膨胀都对芯片的算力、内存、互联提出翻倍要求。昇腾芯片的代际演进,本质上就是在追赶这场"参数爆炸"。
在上一篇中,我们深入拆解了达芬奇架构的内部设计——AI Core 的三大计算单元、存储层次、以及从 arch22 到 arch35 的架构演进。这一篇,我们站在更高的视角,从芯片和系统层面完整梳理昇腾芯片的代际演进路线,看懂每一代的核心技术突破、设计取舍以及行业意义。
二、昇腾芯片完整演进时间线
2018 ────── Ascend 310(边缘推理芯片,功耗仅 8W)
│
2019 ────── Ascend 910(首款云端训练芯片,对标 Tesla V100)
│
│ ╔═══════════════════════════════════════╗
│ ║ 疫情期间的沉淀期(2020-2022) ║
│ ║ 软件栈打磨、生态建设、架构迭代 ║
│ ╚═══════════════════════════════════════╝
│
2023 ────── Ascend 910B(Atlas A2,单 die 成熟版)
│
2025 Q1 ─── Ascend 910C(Atlas A3,双 die 合封)
│
2026 Q1 ─── Ascend 950PR(Atlas A5,自研 HBM,SIMD+SIMT)
│
2026 Q4 ─── Ascend 950DT(HiZQ 2.0 朱雀内存,训练/Decode 场景)
│
2027 Q1 ─── Ascend 960DT(NPO 超节点,性能翻番)
│
2027 Q3 ─── Ascend 960PR
│
2028 ────── Ascend 970(算力再翻倍)
│
2029 ────── Ascend 980
从这张时间线可以看到几个关键信息:
- 2018-2019 年是起步期,310 和 910 分别覆盖推理和训练;
- 2020-2022 年是沉淀期,公开信息较少,但软件栈(CANN、MindSpore)在这三年里进行了大量打磨;
- 2023 年之后进入"一年一代"的高速迭代期,从 910B 到 980,六代芯片在七年内密集发布;
- 950 系列是架构分水岭,从 arch22 跃迁到 arch35,编程模型从纯 SIMD 变为 SIMD+SIMT。
三、Ascend 910B:成熟的起点(Atlas A2)
3.1 关键规格
| 参数 | 规格 |
|---|---|
| 架构 | arch22(第二代达芬奇核心) |
| 核心设计 | 分离架构(AIC + AIV) |
| 计算核心 | 24 AIC + 48 AIV |
| FP16 算力 | ~350 TFLOPS |
| INT8 算力 | ~640 TOPS |
| 内存 | 64GB HBM2E |
| 内存带宽 | ~1.2-1.6 TB/s |
| 互联带宽 | ~784 GB/s(HCCS) |
| 工艺 | 7nm |
| 主频 | 1.8 GHz |
| L0C Cache | 128 KB |
| Unified Buffer | 192 KB |
| L2 Cache | 192 MB |
| FP8/MXFP4 | 不支持 |
3.2 设计特点与历史定位
910B 是 Ascend 910 的成熟改进版,采用单 die 设计,架构上沿用 arch22(第二代达芬奇核心)。它的设计哲学是"稳"——在已验证的架构上做工程优化,提升良率、降低功耗、完善软件栈。
对标分析:910B 的 FP16 算力约 350 TFLOPS,相比 NVIDIA A100 的 312 TFLOPS(FP16 Tensor Core)略有优势。在 INT8 推理场景下,640 TOPS 的算力也能与 A100 正面竞争。这让 910B 成为早期昇腾生态中部署量最大的芯片。
明显短板:不支持 FP8。NVIDIA H100 已经支持 FP8 Tensor Core,B200 更是将 FP8 作为默认训练精度。FP8 的缺失意味着 910B 在新一代大模型训练中,无法享受低精度带来的算力翻倍红利。这是一个架构层面的限制,不是软件能补的。
历史意义:910B 证明了华为有能力设计并量产一款可商用的云端训练芯片,为后续的 910C 和 950 积累了宝贵的工程经验和生态基础。
四、Ascend 910C:双 die 封装的工程创新(Atlas A3
)
4.1 关键规格
| 参数 | 规格 |
|---|---|
| 架构 | arch22(与 910B 完全相同) |
| 核心设计 | 双 910B die 合封(一个封装内两个计算 die) |
| FP16 算力 | ~780-800 TFLOPS |
| 内存 | 128 GB |
| 内存带宽 | ~3.2 TB/s |
| 互联带宽 | 784 GB/s |
| 工艺 | SMIC N+2 |
| 功耗 | ~250W |
4.2 最重要的认知:A3 不是新架构!
这一点怎么强调都不为过:Ascend 910C 的 NPU 架构仍然是 arch22。NPU_ARCH 的值仍为 2201,编译路径与 A2 完全相同(BUILD_MODE=c220,arch22)。换句话说,910C 不是"新一代芯片",而是"同一架构的封装级算力扩展"。
这是一个非常务实的工程决策:
- 在 arch22 架构已经成熟、软件栈完善的前提下,重新设计一代架构需要 2-3 年;
- 但市场对算力的需求是即时的,不可能等 3 年;
- 双 die 合封是一条"快车道"——不改架构、不改编译路径,通过封装级创新实现算力翻倍。
4.3 双 die 封装的技术挑战
把两个计算 die 封装在一起,绝非简单的"1+1"。需要解决的核心问题包括:
- Die 间通信延迟:两个 die 之间的数据通路带宽和延迟直接影响并行效率;
- 功耗与散热:250W 的 TDP 对散热方案提出更高要求;
- 软件透明性:上层应用和算子不需要感知双 die 的存在,编译器自动完成 task 分配。
910C 的 soc_version 有多个后缀(如 9391/9392/9381/9382/9372/9362),这些是 silicon bin 的标识,运行时解析,开发者严禁硬编码。不同 bin 对应不同的体质(频率上限、良率分级),运行时动态适配。
4.4 性能定位与部署现状
910C 的 FP16 算力约为 NVIDIA H100 的 60-70%。虽然单卡性能不及 H100,但配合 CloudMatrix 384 超节点(384 卡全互联拓扑),系统级算力已经可以满足千亿参数模型的训练需求。截至 2025 年,Atlas A3(910C)已部署超过 1000 套,是国内大规模 AI 集群的主力之一。
五、Ascend 950 系列:一芯双构的场景化革命(Atlas A5)
如果说 910B 是"成熟的起点",910C 是"务实的过渡",那么 950 系列就是昇腾芯片历史上最大的一次架构跃迁。
5.1 核心突破
950 系列带来了五项根本性变化:
| 突破点 | 说明 |
|---|---|
| 第三代达芬奇核心 | NPU_ARCH = 3510,架构代号 arch35 |
| 双编程模型 | SIMD + SIMT,首次支持类 GPU 编程范式 |
| 低精度数据格式 | 首次支持 FP8 / MXFP8 / MXFP4 / HiF8 |
| 自研 HBM | 摆脱对外部 HBM 供应商(三星/SK 海力士)的依赖 |
| 内存访问颗粒度 | 从 512B 降至 128B,更适合细粒度访存 |
从 arch22 到 arch35,不只是数字的变化。arch35 引入了 SIMT 编程模型,意味着开发者可以用类似 CUDA 的线程模型来编写算子,大幅降低了从 NVIDIA 平台迁移的门槛。同时,SIMD 路径仍然保留,确保已有的 TBE 算子可以平滑迁移。
5.2 “一芯双构”——昇腾的独创设计
950 系列最引人注目的设计是"一芯双构":共用同一个 Ascend 950 核心 Die,搭配不同的自研 HBM,分化为两个型号。
| 规格 | 950PR | 950DT |
|---|---|---|
| 定位 | Prefill + 推荐场景 | Decode + 训练场景 |
| HBM 型号 | HiBL 1.0(低成本) | HiZQ 2.0 朱雀(高带宽) |
| 内存容量 | 128 GB | 144 GB |
| 内存带宽 | 1.6 TB/s | 4 TB/s |
| Cube FP8 | 865 TFLOPS | 865 TFLOPS |
| Cube MXFP4 | 1730 TFLOPS | 1730 TFLOPS |
| Cube BF16/FP16 | 432 TFLOPS | 432 TFLOPS |
| Vector FP16 | 54 TFLOPS | 54 TFLOPS |
| 计算核心 | 32 AIC + 64 AIV | 32 AIC + 64 AIV(满 die) |
| 互联带宽 | 2 TB/s(灵衢 2.0) | 2 TB/s |
| L2 Cache | 128 MB | 128 MB |
| PCIe | 5.0 x16, 128 GB/s | 5.0 x16, 128 GB/s |
| 量产时间 | 2026 Q1 | 2026 Q4 |
为什么要一芯双构?
这要从大模型推理的两个阶段说起:
- Prefill 阶段(首 token 生成):一次性处理整个 prompt,是计算密集型任务,核心瓶颈是 Cube
算力,对内存带宽要求相对宽松。用低成本 HiBL HBM 就够了。 - Decode 阶段(逐 token 生成):每个 token 的生成都需要读取完整的 KV Cache,是带宽密集型任务,核心瓶颈是
HBM 带宽。必须用 4 TB/s 的 HiZQ 2.0 朱雀
如果统一用高带宽 HBM,Prefill 场景就会为用不满的带宽多花钱;如果统一用低成本 HBM,Decode 场景就会受限于带宽瓶颈。一芯双构的本质是让每一分钱都花在刀刃上。
这种设计类似于 NVIDIA 的 H100/H200 区分(不同 HBM 容量),但昇腾做得更精细——不仅容量不同,带宽规格也完全不同,是真正意义上的"场景化定制"。
5.3 自研 HBM 的战略意义
自研 HBM 可能是 950 系列最被低估的突破。
全球 HBM 市场长期被三星、SK 海力士、美光三家垄断。在供应链紧张的时期,HBM 的交期长达 6-12 个月,价格持续上涨。对华为而言,这意味着:
- 供应链风险:随时可能面临断供或限供;
- 成本不可控:HBM 占 AI 芯片 BOM 成本的 30-40%;
- 定制化受限:无法根据昇腾架构的需求定制 HBM 接口。
华为的自研方案分两条线:
- HiBL 1.0:低成本 HBM,面向 Prefill 场景,大幅降低单位算力的投资成本;
- HiZQ 2.0(朱雀) :高带宽 HBM,4 TB/s,144 GB,面向 Decode 和训练场景。
这不仅填补了国内 HBM 技术的空白,更重要的是让昇腾芯片的内存子系统可以与核心架构深度协同优化——这是外购 HBM 永远做不到的。
5.4 三代芯片全面对比
| 维度 | 910B(A2) | 910C(A3) | 950PR/DT(A5) |
|---|---|---|---|
| 架构 | arch22 | arch22 | arch35 |
| 编程模型 | SIMD only | SIMD only | SIMD + SIMT |
| 核心设计 | 单 die | 双 die 合封 | 新一代核心 die |
| AIC / AIV | 24 / 48 | 24 / 48 × 2 | 32 / 64 |
| FP16 算力 | ~350T | ~800T | 432T |
| FP8 算力 | ❌ 不支持 | ❌ 不支持 | 865T |
| MXFP4 算力 | ❌ 不支持 | ❌ 不支持 | 1730T |
| 内存容量 | 64 GB | 128 GB | 128 / 144 GB |
| 内存带宽 | ~1.4 TB/s | 3.2 TB/s | 1.6 / 4 TB/s |
| 互联带宽 | 784 GB/s | 784 GB/s | 2 TB/s |
| HBM 来源 | 外购 HBM2E | 外购 HBM | 自研 HiBL / HiZQ |
| 内存访问颗粒度 | 512 B | 512 B | 128 B |
注意 950 的 FP16 算力(432T)反而低于 910C(800T),这不是退步——而是因为 FP16 算力不再是核心指标。950 的 FP8 算力(865T)和 MXFP4 算力(1730T)才是真正的杀手锏。低精度计算时代,用 FP16 来比较芯片算力,就像用单核主频来比较 CPU——已经过时了。
六、Ascend 960:NPO 光互连的里程碑
6.1 发布背景
2026 年 9 月 17 日,华为全联接大会 2026 上,Ascend 960 系列正式发布。华为透露,芯片研发进度超出预期——960DT 预计 2027 Q1 就绪(比原计划提前 3 个季度),960PR 预计 2027 Q3 就绪(比原计划提前 1 个季度)。
6.2 核心规格
| 参数 | Ascend 960 |
|---|---|
| FP8 算力 | 2 PFLOPS |
| FP4 算力 | 4 PFLOPS |
| 内存容量 | 288 GB |
| 内存带宽 | 9.6 TB/s |
| 互联带宽 | 2.2 TB/s |
| 数据格式 | 支持 HiF4(业界最优 4bit 精度实现) |
| 960DT 就绪 | 2027 Q1 |
| 960PR 就绪 | 2027 Q3 |
相比 950 系列,960 的 FP8 算力翻倍(2 PFLOPS vs 1 PFLOPS),内存容量从 128/144 GB 提升至 288 GB,内存带宽达到 9.6 TB/s。
6.3 960 超节点——全球首个 NPO 超节点
960 系列最大的看点不在芯片本身,而在系统级创新:全球首个 NPO(Near-Package Optics,近封装光学)超节点。
| 超节点参数 | 数值 |
|---|---|
| 卡规模 | 4096 卡 / 超节点 |
| FP8 总算力 | 8 EFLOPS |
| FP4 总算力 | 16 EFLOPS |
| 总 HBM | 1 PB |
| NPO 光引擎 | 5500 个 Hi-ONE |
| 替代光模块 | 4.8 万颗 800G 光模块 |
| 支撑能力 | 10 万亿参数大模型训练与推理 |
6.4 NPO 技术解读
传统数据中心的互连方式是"电→光→电"转换:芯片发出电信号,经过 PCB 走线到光模块,光模块完成电光转换后通过光纤传输,接收端再做一次光电转换。每一次转换都带来延迟和功耗开销,光模块本身也是数据中心故障率最高的组件之一。
NPO 的核心思想:将光引擎直接封装在芯片封装附近,实现"电→光"的零距离转换。电信号离开芯片后几乎立刻被转换为光信号,省去了 PCB 走线和传统光模块的中间环节。
华为自研的 NPO 光引擎 Hi-ONE 是业界首个量产 NPO 产品:
- 总容量 7.2T
- 唯一实现内置光源的 NPO 产品(内置光源意味着不需要外部激光器,降低了光引擎的复杂度和成本)
- 正交架构 + 全液冷设计
用 5500 个 Hi-ONE 替代 4.8 万颗 800G 光模块,不只是成本和功耗的优化——更意味着互连可靠性的数量级提升。光模块减少了近 90%,故障点也相应减少了 90%。对于需要连续运行数周的大模型训练任务来说,这意味着更少的中断和更高的有效算力利用率。
七、未来路线图:970 与 980
| 芯片 | 时间 | FP8 算力 | FP4 算力 | 内存 | 内存带宽 | 互联带宽 |
|---|---|---|---|---|---|---|
| 950 系列 | 2026 | 1 PFLOPS | 2 PFLOPS | 128/144 GB | 1.6/4 TB/s | 2 TB/s |
| 960 | 2027 | 2 PFLOPS | 4 PFLOPS | 288 GB | 9.6 TB/s | 2.2 TB/s |
| 970 | 2028 | 4 PFLOPS | 8 PFLOPS | 288 GB | 14.4 TB/s | 4 TB/s |
| 980 | 2029 | TBD | TBD | TBD | TBD | TBD |
核心演进规律非常清晰:
- 每代算力翻倍:FP8 从 1P → 2P → 4P,严格遵循 τ 定律(华为版的"摩尔定律");
- 内存容量逐步加倍:从 128 GB 到 288 GB,未来有望达到 576 GB;
- 内存带宽翻两番:从 4 TB/s 到 9.6 TB/s 再到 14.4 TB/s;
- 互联带宽持续提升:从 2 TB/s 到 4 TB/s,NPO 光互连将持续升级。
到 2028 年的 Ascend 970,FP8 算力将达到 4 PFLOPS,FP4 达到 8 PFLOPS。按此推算,单个 4096 卡超节点的 FP8 总算力将达到 16 EFLOPS,足以支撑数十万亿参数模型的训练。
八、技术演进的深层逻辑
8.1 三条演进主线
昇腾芯片的代际演进,可以归纳为三条主线:
主线一:算力维度——低精度化
从 FP16(910B)→ FP8(950)→ FP4/HiF4(960),每一代都在推动更低精度的计算。这不是"偷工减料",而是大模型的特性决定的——研究表明,在合理的量化策略下,低精度训练的模型精度与全精度几乎无差异,但算力可以翻倍甚至翻四倍。
主线二:存储维度——自主可控 + 场景化
从外购 HBM(910B/910C)→ 自研 HBM(950 系列),从统一规格 → 一芯双构(PR/DT 分离)。存储子系统的自主化,是昇腾芯片在供应链安全和技术创新两个维度上的双重保障。
主线三:互联维度——从电到光
从 HCCS 电互连(910B/910C)→ 灵衢 2.0(950)→ NPO 光互连(960)。互联技术的演进,本质上是在解决"算力孤岛"问题——单卡算力再强,如果卡间通信跟不上,也无法组建高效的训练集群。NPO 技术从物理层面突破了电互连的带宽和功耗天花板。
8.2 与 NVIDIA 的演进路径对比
| 维度 | NVIDIA | 华为昇腾 |
|---|---|---|
| 迭代节奏 | ~2 年一代(A100→H100→B200) | ~1 年一代(950→960→970) |
| 架构路线 | GPU 通用计算(CUDA 生态) | NPU 特定域 → 类 GPU 通用化(arch35 引入 SIMT) |
| 编程模型 | CUDA(统一,20 年积累) | CANN(从 SIMD → SIMD+SIMT,正在降低迁移门槛) |
| 内存策略 | 外购 HBM(三星/SK 海力士/美光) | 自研 HBM(HiBL/HiZQ),自主可控 |
| 场景分化 | H100/H200(HBM 容量区分,计算核心相同) | 950PR/950DT(HBM 带宽和容量均不同,真正场景化) |
| 互连创新 | NVLink / NVSwitch(电信号) | 灵衢 + NPO 光引擎 Hi-ONE(光电融合) |
两个最值得关注的差异:
第一,迭代节奏。 NVIDIA 大约每 2 年推出一代新架构(Ampere→Hopper→Blackwell),华为则保持每年一代的节奏。这意味着华为单代的架构变化幅度小于 NVIDIA,但累计迭代速度更快。910C 的"双 die 不改架构"就是这个策略的体现——用工程创新填平架构代际之间的空档。
第二,内存自主化。 NVIDIA 完全依赖三星、SK 海力士和美光的 HBM,这意味着 NVIDIA 的内存子系统优化受限于供应商的产品规格。华为的自研 HBM 虽然初始性能和成熟度可能不及三星/SK 海力士的顶级产品,但可以针对昇腾架构做深度定制——例如 128B 的内存访问颗粒度,就是为昇腾 Cube 单元的数据块大小量身设计的。
8.3 "一年一代"背后的工程挑战
保持"一年一代"的节奏,绝非易事。背后的挑战包括:
- 芯片设计效率:每次流片的成本高达数千万美元,设计周期必须压缩到 12 个月以内。这要求极高的 IP 复用率和自动化设计工具链支撑。
- 验证流程:AI 芯片的功能验证和性能验证极其复杂,需要在仿真、FPGA 原型验证、流片后验证三个阶段都保持高度效率。
- 软件栈同步迭代:每一代新芯片都需要 CANN、TorchNPU、MindSpore 等软件栈的同步适配。硬件快而软件慢,是 AI
芯片公司最常遇到的问题。 - 生态兼容性:已有算子、模型、训练框架需要在新芯片上无缝运行。arch22 → arch35 的架构跃迁,CANN
提供了自动迁移工具,但迁移质量仍需要大量验证。 - 自研 HBM 的良率与量产:HBM 是三维堆叠结构(TSV 硅通孔),制造难度极高。自研 HBM 的良率爬坡是 950
量产的关键瓶颈之一。
九、总结
回顾昇腾芯片的演进历程,四个核心结论:
第一,从"跟随者"走向"创新者"。 910B 对标 A100,910C 对标 H100(约 60-70% 性能),这个阶段昇腾是在"追赶"。但到了 950 系列,“一芯双构"的场景化设计和自研 HBM 的引入,标志着昇腾开始在特定方向上"引领”——这种 Prefill/Decode 分离的设计理念,可能会影响整个行业的产品策略。
第二,自研 HBM 和 NPO 光互连是两大战略性突破。 前者解决了供应链安全和深度定制的问题,后者突破了系统级互连的带宽天花板。这两项技术不是渐进式改进,而是从根本上改变了昇腾芯片的技术底座。
第三,"一年一代"的节奏在全球 AI 芯片中属于最激进。 考虑到制裁环境下的供应链约束,能保持这个迭代速度,体现了华为在芯片设计、封装、HBM、互连等多个技术方向上的系统性投入。
第四,从 arch22 到 arch35 的架构跃迁,标志着昇腾从"专用 NPU"走向"通用 AI 计算平台"。 SIMT 编程模型的引入,大幅降低了 NVIDIA 开发者的迁移成本。这不是简单的"抄 CUDA",而是在保留 NPU 能效优势的同时,吸收了 GPU 的编程便利性——一条"第三条道路"。
昇腾芯片的故事,本质上是一家企业在极端约束条件下,如何通过系统性创新实现技术追赶和超越的故事。从 910B 的"跟随",到 910C 的"工程创新",到 950 的"架构突破",再到 960 的"系统级引领",每一步都有清晰的技术逻辑和战略考量。
而这场竞赛,还远未结束。
下一篇预告
第 4 篇:CANN 异构计算架构:五层分层设计全解
芯片再强,也需要软件栈来释放算力。下一篇,我们深入解析 CANN(Compute Architecture for Neural Networks)的五层分层架构:
AscendCL:统一的应用编程接口,如何屏蔽底层硬件差异
GraphCompiler:计算图编译器,如何把 Python 模型变成 NPU 上高效运行的机器码
TBE(Tensor Boost Engine):自定义算子开发框架,SIMD 编程的入口
Runtime:运行时管理,如何实现多核、多卡的 task 调度
HCCL(Huawei Collective Communication Library):分布式通信库,如何实现千卡高效协同
以及 CANN 开源社区的运作模式,和开发者如何参与生态建设。
敬请期待。
本文是「昇腾深度学习技术系列」第 3 篇。系列覆盖从芯片架构到框架、从算子开发到集群训练的完整知识体系,共 20 篇,持续更新中。
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐


所有评论(0)