8卡昇腾910、2.2 PFLOPS算力压进4U:HG9680 AI服务器架构全拆解
鐩綍
HG9680 4U AI服务器:8卡昇腾910架构拆解与选型分析
8颗昇腾910 NPU、2.2 PFLOPS FP16算力、256GB HBM片上内存、8×200GE RoCE网络——这些参数塞进一台4U机箱里意味着什么?本文从白皮书规格出发,拆解HG9680的硬件架构、互联拓扑和选型边界。
这台机器解决什么问题
大模型训练和推理对算力密度的要求越来越高。单卡显存不够用,多卡互联带宽不够快,机房机柜空间不够放——这三个痛点同时存在的时候,你需要一台高密度AI服务器。
HG9680是联智达(Linkupai)推出的4U AI服务器,核心配置是8颗昇腾910 NPU + 4颗鲲鹏920 CPU,面向大模型训练、推理和高性能计算场景。

硬件架构总览
计算单元:8× 昇腾910 + 4× 鲲鹏920
| 组件 | 型号 | 数量 | 关键参数 |
|---|---|---|---|
| NPU | 昇腾910 | 8 | AI算力 2.2 PFLOPS@FP16 |
| CPU | 鲲鹏920 | 4 | 32× DDR4 DIMM @3200MT/s |
| 片上内存 | HBM | - | 256GB / 512GB 可选 |
| 互联 | HCCS Full Mesh | - | 全互联拓扑 |
8颗昇腾910通过HCCS Full Mesh互联,任意两颗NPU之间可以直接通信,不需要经过CPU中转。这对多卡并行训练至关重要——梯度同步的延迟直接取决于互联拓扑的跳数。
网络配置:8× 200GE RoCE v2
| 接口 | 规格 | 数量 | 用途 |
|---|---|---|---|
| QSFP | 200GE RoCE v2 | 8 | 节点间高速互联 |
| PCIe | 4.0 扩展槽 | 3 | GPU/FPGA/网卡扩展 |
8个200GE RoCE v2端口可以组建大规模集群。RoCE v2绕过TCP/IP协议栈,直接在以太网上实现RDMA,延迟比传统TCP低一个数量级。
存储与扩展
| 存储 | 规格 | 数量 |
|---|---|---|
| 2.5" SATA | SSD/HDD | 8 |
| 2.5" NVMe | SSD | 2 |
| 可选配置 | SATA+NVMe | 4+6 |
支持RAID 0/1/10/5/50/6/60,覆盖从性能到容错的主流场景。
关键参数对实际场景的影响
算力:2.2 PFLOPS FP16
8颗昇腾910合计提供2.2 PFLOPS的FP16算力。单颗昇腾910的FP16算力约256 TFLOPS,8颗线性扩展效率在90%以上时,集群总算力约2.2 PFLOPS。
这个算力级别能做什么:
- 训练:百亿参数级模型的分布式训练(需要多节点扩展)
- 推理:千亿参数模型的单机推理服务
- HPC:科学计算中的稠密矩阵运算
内存:256GB/512GB HBM
HBM(高带宽内存)直接封装在NPU芯片旁边,带宽远高于DDR4。256GB和512GB两个版本对应不同规模的模型:
- 256GB:可加载约70B参数的FP16模型
- 512GB:可加载约175B参数的FP16模型
实际可用显存取决于框架开销和KV Cache配置,通常打85折。
网络:8× 200GE RoCE v2
8个200GE端口聚合带宽1.6 Tbps。在多节点训练中,每个节点通过RoCE v2互联,AllReduce效率取决于网络配置。
# 集群网络带宽估算示例
nodes = 4 # 4节点集群
ports_per_node = 8
port_speed_gbps = 200
total_bandwidth = nodes * ports_per_node * port_speed_gbps
print(f"集群聚合带宽: {total_bandwidth / 1000:.1f} Tbps")
# 输出: 集群聚合带宽: 6.4 Tbps

散热与功耗
| 项目 | 规格 |
|---|---|
| 电源 | 4× 2.6kW,2+2冗余 |
| 散热方式 | 液冷 |
| 风扇 | 8个散热风扇模块,N+1冗余 |
| 尺寸 | 4U(175×447×790mm) |
8颗NPU满载功耗不低,液冷方案比风冷能提供更稳定的散热性能。4个2.6kW电源做2+2冗余,满载时两组电源同时供电,单组故障时另一组可以接管。
选型边界与限制
这台机器不是万能的,以下场景需要评估:
-
生态兼容性:昇腾910使用CANN软件栈,需要确认你的模型是否已适配。PyTorch通过torch_npu插件支持,但部分自定义算子可能需要手动适配。
-
机柜供电:满载功耗超过10kW,普通机房单机柜供电可能不够,需要提前确认机柜电力容量。
-
液冷基础设施:需要机房提供冷却液管路接口,传统风冷机房需要改造。
-
软件版本:CANN版本与模型框架版本有对应关系,升级时需要注意兼容性矩阵。
验证方法
选型前建议按以下步骤验证:
| 步骤 | 内容 | 方法 |
|---|---|---|
| 1 | 模型适配性 | 在昇腾开发者社区查CANN兼容性列表 |
| 2 | 算力验证 | 跑MLPerf基准或自研模型benchmark |
| 3 | 网络测试 | 测试RoCE v2多节点AllReduce带宽 |
| 4 | 散热验证 | 满载72小时烤机,监控温度曲线 |
| 5 | 供电确认 | 确认机柜PDU额定功率和插座类型 |
选型结论
HG9680适合以下场景:
- 需要高密度昇腾算力的大模型训练和推理
- 国产化替代场景下的AI计算平台
- 对互联带宽有高要求的多卡并行任务
不适合的场景:
- 只用CUDA生态的项目(昇腾不支持CUDA)
- 机房没有液冷基础设施的部署环境
- 单卡推理即可满足的小模型场景
产品信息来源:Linkupai HG9680 4U白皮书。规格参数以厂商最新文档为准。
咨询电话:400-869-9865 | 官网:www.linkupai.cn
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐


所有评论(0)