一体机宣传的是开箱即用,自建说的是灵活可扩,但很少有人把两条路拉到同一张表上,把「这 5 年到底要花多少钱、要操多少心」算清楚。一体机的钱多半花在「预装 + 预适配 + 整机交付」上;自建的钱则花在「选型、接线、装驱动、调适配、反复验证」的人力和时间上。差别不在第一张发票,而在交付周期、扩容刚性、运维负担这三件事怎么取舍。下面我按交付周期 / 前期成本 / 扩容 / 运维 / 信创 / 适配六个维度对齐比较,再摊开算一笔 5 年 TCO 估算账——口径是采购 + 电力 + 散热 + 维保 + 人工,假设会一条条标出来。

一、两条路的本质差别:一个买「整包」,一个买「零件」

AI 一体机(以商红官网在售的昇腾 920S 为例:32 核 / 128G 内存 / 2 张 Atlas 300I Duo 96G / 液冷,用于 DeepSeek 本地部署)的核心是「整包」。机器出厂前就把系统、推理框架(昇腾 CANN + MindIE / vLLM-Ascend)、模型权重(含量化版本)和显存算力预估做好,搬进机房接线通电就能跑。它买的是一段「已经铺好的路」。

自建服务器是「零件」路线:你按预算挑服务器整机(如浪潮 NF5280M6 / NF5468M6 / NF5468M7,联想 ThinkStation PX / WA5480 G3,DELL PowerEdge R760 等),再决定挂通用 GPU(RTX 4090 / L20 / H100)还是昇腾 Atlas 300I Duo。机器回来只是第一步,后面还有上 riser 卡、走 GPU 供电、装驱动、选推理框架、调显存参数、跑一轮验收,路要自己铺。

一句话记住差别:一体机买「确定性」,自建买「可能性」。 前者交付快、适配好,但扩展跟着机身走;后者能按预算、按模型演化慢慢堆,但每一层都要你自己扛。

二、适用边界:条件不同,答案不同

先给判断,再看怎么对号入座。

一体机更适合:模型和业务基本确定、短期不换(比如固定跑几个开源模型做企业私有化推理);运维人手少,不想养一个懂 CUDA/昇腾 适配的专职岗;有信创/国产化合规压力,需要整机层面就国产化;交付时间卡得紧,要求上线即用。

自建更适合:模型很可能会换,或者既要推理又要微调、逐步加卡;团队里有能调适配、看得住 GPU/昇腾卡的技术同学;预算想按「先小后大」分期到位,而不是一次压满;对扩容有明确预期,想保留「几年后自己加卡加节点」的灵活性。

一个容易踩的认知误区是:把「配置灵活」当成「买得便宜」。自建前期采购确实能压,可如果你没有人做适配验证,省下的设备钱会变成上涨的工时——这两笔账要放在一起算。

三、同一张表:六个维度对齐比较

维度 昇腾 AI 一体机(如 920S + Atlas 300I Duo) 自建服务器(浪潮/联想/DELL 整机 + GPU 或昇腾卡)
交付周期 短:整机预装预适配,通电即可用 长:选型→接线→装驱动→调适配→验收,上线前还有一段验证期
前期成本 高:整机 + 预装适配打包,一次到位 按预算灵活:先小后扩,但要另计适配人力与时间成本
扩容能力 刚性:受机箱、供电、散热、出厂配置约束,加卡要确认厂家支持 灵活:可加卡、加节点、换框架,但要自己验证兼容与供电散热
运维复杂度 低:厂家整体支持,问题好定位 高:监控、告警、故障排查、驱动升级都要自己搭
信创/国产化 强:昇腾整机,天然国产化 看配置:可配海光/昇腾走国产化,也可用通用 GPU
生态/适配 窄:以厂家预装框架与模型为主 宽:vLLM / Ollama / Transformers 自由选,模型想换就换

开箱即用不是免费:一体机把「安装 + 适配 + 验证」这类看不见的成本,提前折算进了整机价里。自建则是把这些成本还给了你的工程师时间。

四、5 年 TCO 估算口径(假设都标出来)

TCO 我按这样一个口径算,它不是任何厂商报价,只是一个估算框架,实际数值以项目实测为准。四块构成:

1. 采购成本(CAPEX)
一体机 = 整机价(含预装适配)。自建 = 整机价 + GPU/昇腾卡 + 适配人力。注意别漏了自建的「适配工时」。

2. 电力成本
公式:整机满载功耗 × 上架率 × 24h × 365天 × 5年 × 电价。
假设示例:整机满载约 3.5kW,上架平均负载 50%,电价 0.8 元/度——
3.5 × 0.5 × 24 × 365 × 5 × 0.8 ≈ 6.1 万元(仅作演示,功率、上架率、电价按你实际情况代入)。

3. 散热成本
一体机走液冷(920S 为液冷方案)散热效率更高;自建通常配风冷机房,空调制冷额外电耗可按 PUE 计(机柜 IT 负载每 1kW,机房总耗电约 1.3~1.5kW,具体以机房实测为准)。

4. 维保 + 人工
一体机按整机质保/延保,人工少;自建按部件保(主板/电源/GPU/CANN 或 CUDA 适配),还要折算工程师值守、故障排查的人天。

落到结论: 如果模型固定、规模不大、长期低负载,一体机通常更省心,而且省下来的人工可能抵消前期高出的采购价;如果模型会变、要训要扩、负载高,自建前期省的钱,长期看会被扩容能力和「自己想换就换」的灵活性摊薄。没有绝对谁更便宜,只有「在你这套负载下谁更划算」——需要拿你的功耗、电价、人天去代进上面的框架。

五、决策树:三步对号入座

选型前先问自己三个问题,逐级往下走:

第一步:模型/业务是否已经确定、短期不变?
  ├─ 是 → 进入第二步
  └─ 否(可能要训模型、要换来换去)→ 自建(按预算配整机,留扩容弹性)

第二步:有没有技术团队能长期做适配、盯运维?
  ├─ 没有 → 一体机(交钥匙,省人力)
  └─ 有  → 进入第三步

第三步:预算是一次性到位,还是想分期/按需扩?
  ├─ 一次性、规模固定 → 若需信创/国产化选昇腾一体机;
  │                     否则可在「一体机」与「自建」间看性价比再定
  └─ 分期/按需扩      → 自建(先小后扩,按预算逐步加)

六、判断清单(可复用)

预算有限、要先小后扩:优先自建,留意加上适配人力。
交付时间卡得死、要上线即用:优先一体机。
有信创/国产化合规要求:优先昇腾整机或一体机,自建也要优先配海光/昇腾卡。
运维人手不足:优先一体机,把运维成本外包给整机质保。
模型会变、要训练/微调:给自建留够 GPU 与框架自由度。
不管选哪条,先把显存预算算清楚:显存 ≈ 权重(参数 × 位宽字节)+ KV cache(与 max_model_len、batch 相关)+ 激活值 overhead。FP16 权重约参数 × 2 字节,4bit 量化约参数 × 0.5 字节。比如官方蒸馏的 R1-Distill 70B,4bit 权重约 35GB,再加 KV cache;2 张 Atlas 300I Duo 96G ≈ 192G,跑蒸馏版 32B/70B 的私有化推理是够的,训练则要再按梯度/优化器状态(Adam 约参数 × 12 字节,LoRA 可大幅减少可训练参数量)单独估。这些估算只是选型口径,具体还需按你的 max_model_len 和 batch 用 vLLM 的 --gpu-memory-utilization / --tensor-parallel-size 实测校准。

如果你符合「要信创 + 交付要快 + 运维人少」这几个条件,可以找商红科技这类既能提供昇腾 920S 一体机、也能按你预算配浪潮/联想整机的本地集成商,先按你的功耗、电价、人天要一份配置再比一遍,而不是只看初始报价。

七、结尾

综上,我的结论是:一体机赢在确定性和交付速度,自建赢在灵活性和扩展空间;5 年 TCO 不是「谁更便宜」的单选题,而是「在你这套负载下谁更划算」的匹配题。 决策树和判断清单都在上面,可以直接拿去用。

你在私有大模型选型时,更看重「开箱即用、交付快」,还是「以后还能改、还能扩」?有没有踩过一体机想加卡被机身卡住、或者自建上线周期比预期长很多的坑?欢迎在评论区聊聊你的实际经历。

(机型、显存、命令等参数核对以官网与实测为准;更细的产品说明可以回官网 www.bencom.cn 看。)

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐