一、超融合设备的核心

可以把它想象成一个“乐高”模型:

  • 超融合并部署简单的“物理组装”:不仅仅是把多套已经拼好的乐高城堡(服务器)简单堆放在一起。虽然它们物理上靠近,但每套却不是独立运作的。
  • 实际的超融合(“软件定义”):更像是将无数零散的乐高积木(CPU、内存、硬盘等),通过一个统一的“拼搭说明书”(超融合软件),构建成一个庞大、完整、协同工作的“乐高城市”。

具体来说,有以下几个核心区别:

💡 核心:软件是大脑,硬件是躯体

超融合的真正灵魂在于其软件。

  • 传统架构:计算、存储、网络由各自独立的硬件设备(如服务器、SAN存储阵列、交换机)分别提供。
  • 超融合架构:通过软件定义的方式,将每台标准x86服务器内的CPU、内存、硬盘等资源虚拟化,并由统一的软件层进行智能调度和管理。

🧩 分布式与横向扩展:如同搭积木

超融合以集群方式部署。每个服务器节点都是地位对等的,包含计算和存储能力。

  • 扩展方式:当性能不足时,只需简单增加新的服务器节点(横向扩展/Scale-out)。系统会自动将新资源纳入统一资源池,实现性能的线性提升。
  • 与“物理组装”的区别:超融合节点间通过高速网络紧密协作,作为整体对外提供服务,而非独立工作。

📦 一体化交付与管理:开箱即用

超融合设备(常以“超融合一体机”形式交付)是软硬件预集成、预优化的整体解决方案。

  • 统一管理:提供一个统一的管理平台,管理员可以在单一界面上管理所有节点的计算、存储和网络资源。
  • 高可用性:具备自动故障转移和数据恢复能力。
  • 与“物理组装”的区别:它提供的是一套开箱即用的完整系统,而非一堆需要自行组装调试的硬件。

总而言之,超融合设备 = (标准服务器硬件 + 高速网络) × 强大的软件定义能力

它不是简单的硬件堆砌,而是通过软件的力量,将多台独立的服务器融合成一个高度集成、易于扩展、统一管理的强大资源池。


二、物理层/软件层设计

1. 物理层面

物理硬件的视角看,:

  • 一个节点 = 一台物理主机(标准6服务器)。
  • 多个节点 = 多台物理主机
  • 每台主机都有自己独立的CPU、内存、硬盘、MAC地址,以及用于管理硬件的管理IP地址(BMC/IPMI)。

2. 逻辑/软件层面

超融合最大的“魔法”在于软件层,它颠覆了对传统“单机操作系统”和“独立硬盘”的认知:

  • 关于“操作系统”

    • 每台物理主机上确实安装了一个底层操作系统(虚拟化内核,如ESXi、KVM),但这个系统极其精简,仅用于跑虚拟机
    • 重点来了:实际使用的“业务操作系统”(比如Windows/Linux虚拟机)并不属于某个固定节点。它们像“漂浮”在集群中的“幽灵”,可以在节点之间自由热迁移(关机都不需要),根本不需要关心它此刻在哪台物理机上运行。
  • 关于“硬盘/存储”这是最大的误区。

    • 虽然每个节点有自己的物理硬盘,但在超融合软件眼中,这些硬盘是“公共积木”。软件会把所有节点的硬盘打散,组合成一个统一的分布式共享存储池
    • 也就是说,不必像用普通电脑那样去管理“节点A的D盘”和“节点B的E盘”。面对的只是一个巨大的虚拟硬盘。即使某块物理硬盘坏了,数据也会自动在别的节点上重建,业务不受影响。
  • 关于“IP地址”需要区分两种IP。

    • 管理IP:每个节点确实有独立的物理管理IP(用于底层硬件维护)。
    • 业务IP:虚拟机有自己的虚拟IP。当虚拟机从节点1漂移到节点2时,它的业务IP保持不变,用户完全无感知。

3. 关于“统一平台调配资源”

这个统一平台(如VMware vCenter、深信服云计算平台等)做的不是“手动调配单台主机”,而是**“全局资源调度”**:

  • 当节点1负载过高时,平台会自动把节点1上的虚拟机“漂移”到空闲的节点2上。
  • 增加新节点时,平台会自动把新节点的CPU/内存加入总池子,把新硬盘的容量加入总存储池,无需人工逐台配置

给一个生动的比喻:
把它想象成一个**“蜂群”**:

  • 单个节点(主机) = 一只工蜂(有独立的翅膀、腿和触角/IP)。
  • 独立操作系统 = 工蜂的个体本能(负责执行指令)。
  • 业务系统(虚拟机) = 蜂群要搬运的那滴花蜜。工蜂们(多节点)可以自由接力传递这滴花蜜,花蜜本身不需要知道此刻在谁嘴里,也不绑定某只工蜂。
  • 统一管理平台 = 蜂王的信息素,指挥哪只工蜂累了就休息,换另一只上。

所以,超融合绝不是“多台独立电脑各干各的”,而是把多台主机“焊接”成一个超级计算机,感觉只在使用一台永不宕机、无限扩容的“巨无霸主机”。


三、虚拟化操作系统

一个超融合节点(物理主机)不仅可以虚拟多个操作系统,而且它存在的唯一目的就是为了干这个

为了更清晰,把它拆解成“能装几个”和“怎么装”两个层面:

1. 能虚拟多少个操作系统?(取决于配置)

一台标准配置的超融合节点(比如 64核CPU、256GB内存),通常可以轻松运行 20-50个 不同的操作系统实例(即虚拟机)。具体数量取决于给每个虚拟机分配多少资源:

  • 如果每个虚拟机是轻量级的Linux(分配 2核CPU、4GB内存),可以跑很多个。
  • 如果每个虚拟机是重型数据库(分配 16核CPU、64GB内存),那能跑的数量就会相应减少。
    简单说:只要物理主机的CPU、内存、硬盘容量够用,想虚拟几十个甚至上百个操作系统都是允许的。

2. 它是怎么实现的?(关键架构)

这里需要区分两个“操作系统”的概念,这也是很多人容易混淆的地方:

  • 底层(宿主机):这台物理主机只安装一个非常精简的底层系统(专业术语叫Hypervisor(虚拟化内核),如VMware ESXi、KVM)。它不干别的,只充当“房东”的角色,负责管理物理硬件资源。
  • 上层(虚拟机):在这个“房东”之上,可以同时安装几十个互不干扰的“租客”。这些租客可以是Windows、CentOS、Ubuntu、麒麟等完全不同的操作系统,它们各自拥有独立的虚拟CPU、虚拟内存、虚拟硬盘和虚拟MAC/IP地址。

3. 它们之间是什么关系?

这些虚拟机完全隔离,运行在一个虚拟机里的病毒崩溃了,完全不影响同一台物理机上的其他几十个虚拟机。它们共享物理主机的CPU计算能力和内存,但通过底层的Hypervisor进行严格地隔离和资源配额限制(比如限定A虚拟机最多只能用30%的CPU)。


结合之前的“超融合集群”再升华一下:

  • 单节点上,可以虚拟几十个操作系统。
  • 超融合集群(多节点)中,这个能力被放大了。管理平台不仅允许在同一台物理机上虚拟几十个系统,还允许把这几十个系统随意“飘”到别的物理节点上

举个例子:节点1上跑了40个虚拟机,节点2只跑了10个。管理平台检测到节点1太累了,会自动把节点1上的10个虚拟机(连同它们的IP、运行状态)“热迁移”到节点2上,整个过程业务不中断。对于(管理员)来说,根本不需要关心这几十个操作系统此刻“肉身”在哪台物理机上,只需要管理好这几十个“逻辑主机”就行了。

所以,超融合带来的不仅是“一台物理机跑多个系统”,更是“一群物理机共同支撑成百上千个系统,且永不停机”。


四、高可用性

那接下讲一个核心问题:“这么多系统放在一起,怎么保证不崩、数据不丢、网络不乱?”

现在把超融合剩下的核心黑科技梳理成三条“进阶路线”:

路线一:如果一台物理机突然“猝死”,上面的虚拟机怎么办?(高可用性 HA)
这是超融合最实用的“保险丝”功能。假设节点1因停电或硬件故障彻底宕机,上面的几十个虚拟机并不会消失。管理平台会在几秒内检测到故障,并自动在节点2或节点3上重新启动这些虚拟机。整个过程无需人工介入,业务中断时间通常只有1-3分钟(取决于系统启动速度),这就是“无人值守的自动救场”。

路线二:所有节点的硬盘拼成了一个“大池子”,数据到底是怎么存的?(分布式存储机制)
既然存储是“公共”的,那数据就不能只存在某一个节点的硬盘上,否则那个节点坏了数据就全丢了。超融合的做法是:“鸡蛋不放在一个篮子里”。比如存一个文件,系统会自动拆分成小块,并同时复制2份或3份(副本),强制保存在不同的物理节点上。即使坏掉整整一台服务器,数据在其他节点上依然完好无损,业务连“卡顿”都不会有。

路线三:成百上千个虚拟机之间,网络怎么隔离和互通?(网络虚拟化 / SDN)
想象一下,一台物理机里住了几十个“租客”(虚拟机),它们有的要对外网提供服务(需要公网IP),有的要跟其他物理机里的虚拟机通信,有的则需要完全隔离(比如财务系统)。这不能靠插网线解决。超融合通过虚拟交换机,在软件层面给每个虚拟机“画”出独立的虚拟网卡、虚拟防火墙和VLAN(虚拟局域网)。虚拟机在节点间漂移时,它身上的所有网络配置和安全策略会像影子一样跟着走,不需要重新改IP、开防火墙。


这三条路线,分别对应了**“保命(高可用)”、“保数据(存储)”、“保通信(网络)”**。


五、国产架构

✅ 主流ARM架构的超融合一体机:

ARM架构的超融合一体机已经是市场上的成熟产品,这主要得益于国产化(信创)趋势的推动。很多主流厂商都推出了基于ARM处理器的产品:

  • 华为:其FusionCube系列有基于鲲鹏920 ARM处理器的产品,单节点核心数可达80核甚至128核。
  • 深信服:提供针对ARM架构设计的aServer-G系列超融合一体机。
  • H3C:UIS系列超融合一体机也同时支持x86和ARM架构。
  • 其他厂商:星环科技、SmartX等也都有基于ARM处理器的超融合产品或方案。

🤔 x86与ARM混合部署?:

x86与ARM混合部署可以做到“统一管理”,而非“完全融合”

这是最关键的区别。对于混合部署,目前业界主流做法是 “资源池隔离,统一平台管理” ,而不是将x86和ARM节点放进同一个“资源池”里完全融合。

  • “资源池隔离”:在管理平台上,分别建立独立的 x86资源池和ARM资源池。x86节点加入x86池,ARM节点加入ARM池。
  • “统一管理”:管理员可以通过同一个管理界面,对这两个独立的资源池进行监控、运维和资源分配。

比如H3C UIS、青云云易捷、UCloud优钛超融合等,都采用了这种“一云多芯”的混合架构模式。

这种模式与“完全融合”的核心区别在于:

  • 虚拟机无法跨架构迁移:由于x86和ARM的CPU指令集不同,一个在x86节点上创建的虚拟机无法直接迁移到ARM节点上运行。
  • 并非所有厂商都支持:一些主流厂商如VMware vSAN、Nutanix等,其核心产品并不支持这种混合部署模式。

📝 总结与建议

  1. ARM超融合是成熟选项:如果需求是构建一个纯ARM架构的集群,市面上有很多成熟的一体机产品可供选择。
  2. 混合部署的关键是“管理”而非“融合”:如果环境中既有x86服务器又有ARM服务器,并希望统一管理,可以寻求支持“一云多芯”的厂商方案。但需要清楚地认识到,这更多是管理层面的统一,底层资源池仍是隔离的。
  3. 根据业务需求选择
    • 全新部署:可以根据业务场景(如高性能计算选ARM,通用计算选x86)选择单一架构。
    • 信创改造:如果是为了替换原有的x86架构,ARM(如鲲鹏、飞腾)是主流选择。
    • 过渡阶段:如果业务需要同时运行在两种架构上,可以选择支持“一云多芯”的管理平台,分池管理。
Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐