HG9680 4U AI服务器:8卡昇腾910架构拆解与选型分析

8颗昇腾910 NPU、2.2 PFLOPS FP16算力、256GB HBM片上内存、8×200GE RoCE网络——这些参数塞进一台4U机箱里意味着什么?本文从白皮书规格出发,拆解HG9680的硬件架构、互联拓扑和选型边界。

这台机器解决什么问题

大模型训练和推理对算力密度的要求越来越高。单卡显存不够用,多卡互联带宽不够快,机房机柜空间不够放——这三个痛点同时存在的时候,你需要一台高密度AI服务器。

HG9680是联智达(Linkupai)推出的4U AI服务器,核心配置是8颗昇腾910 NPU + 4颗鲲鹏920 CPU,面向大模型训练、推理和高性能计算场景。

HG9680服务器外观

硬件架构总览

计算单元:8× 昇腾910 + 4× 鲲鹏920

组件 型号 数量 关键参数
NPU 昇腾910 8 AI算力 2.2 PFLOPS@FP16
CPU 鲲鹏920 4 32× DDR4 DIMM @3200MT/s
片上内存 HBM - 256GB / 512GB 可选
互联 HCCS Full Mesh - 全互联拓扑

8颗昇腾910通过HCCS Full Mesh互联,任意两颗NPU之间可以直接通信,不需要经过CPU中转。这对多卡并行训练至关重要——梯度同步的延迟直接取决于互联拓扑的跳数。

网络配置:8× 200GE RoCE v2

接口 规格 数量 用途
QSFP 200GE RoCE v2 8 节点间高速互联
PCIe 4.0 扩展槽 3 GPU/FPGA/网卡扩展

8个200GE RoCE v2端口可以组建大规模集群。RoCE v2绕过TCP/IP协议栈,直接在以太网上实现RDMA,延迟比传统TCP低一个数量级。

存储与扩展

存储 规格 数量
2.5" SATA SSD/HDD 8
2.5" NVMe SSD 2
可选配置 SATA+NVMe 4+6

支持RAID 0/1/10/5/50/6/60,覆盖从性能到容错的主流场景。

关键参数对实际场景的影响

算力:2.2 PFLOPS FP16

8颗昇腾910合计提供2.2 PFLOPS的FP16算力。单颗昇腾910的FP16算力约256 TFLOPS,8颗线性扩展效率在90%以上时,集群总算力约2.2 PFLOPS。

这个算力级别能做什么:

  • 训练:百亿参数级模型的分布式训练(需要多节点扩展)
  • 推理:千亿参数模型的单机推理服务
  • HPC:科学计算中的稠密矩阵运算

内存:256GB/512GB HBM

HBM(高带宽内存)直接封装在NPU芯片旁边,带宽远高于DDR4。256GB和512GB两个版本对应不同规模的模型:

  • 256GB:可加载约70B参数的FP16模型
  • 512GB:可加载约175B参数的FP16模型

实际可用显存取决于框架开销和KV Cache配置,通常打85折。

网络:8× 200GE RoCE v2

8个200GE端口聚合带宽1.6 Tbps。在多节点训练中,每个节点通过RoCE v2互联,AllReduce效率取决于网络配置。

# 集群网络带宽估算示例
nodes = 4  # 4节点集群
ports_per_node = 8
port_speed_gbps = 200

total_bandwidth = nodes * ports_per_node * port_speed_gbps
print(f"集群聚合带宽: {total_bandwidth / 1000:.1f} Tbps")
# 输出: 集群聚合带宽: 6.4 Tbps

HG9680内部架构

散热与功耗

项目 规格
电源 4× 2.6kW,2+2冗余
散热方式 液冷
风扇 8个散热风扇模块,N+1冗余
尺寸 4U(175×447×790mm)

8颗NPU满载功耗不低,液冷方案比风冷能提供更稳定的散热性能。4个2.6kW电源做2+2冗余,满载时两组电源同时供电,单组故障时另一组可以接管。

选型边界与限制

这台机器不是万能的,以下场景需要评估:

  1. 生态兼容性:昇腾910使用CANN软件栈,需要确认你的模型是否已适配。PyTorch通过torch_npu插件支持,但部分自定义算子可能需要手动适配。

  2. 机柜供电:满载功耗超过10kW,普通机房单机柜供电可能不够,需要提前确认机柜电力容量。

  3. 液冷基础设施:需要机房提供冷却液管路接口,传统风冷机房需要改造。

  4. 软件版本:CANN版本与模型框架版本有对应关系,升级时需要注意兼容性矩阵。

验证方法

选型前建议按以下步骤验证:

步骤 内容 方法
1 模型适配性 在昇腾开发者社区查CANN兼容性列表
2 算力验证 跑MLPerf基准或自研模型benchmark
3 网络测试 测试RoCE v2多节点AllReduce带宽
4 散热验证 满载72小时烤机,监控温度曲线
5 供电确认 确认机柜PDU额定功率和插座类型

选型结论

HG9680适合以下场景:

  • 需要高密度昇腾算力的大模型训练和推理
  • 国产化替代场景下的AI计算平台
  • 对互联带宽有高要求的多卡并行任务

不适合的场景:

  • 只用CUDA生态的项目(昇腾不支持CUDA)
  • 机房没有液冷基础设施的部署环境
  • 单卡推理即可满足的小模型场景

产品信息来源:Linkupai HG9680 4U白皮书。规格参数以厂商最新文档为准。

咨询电话:400-869-9865 | 官网:www.linkupai.cn

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐