等了四个月之后,这家公司做了一件事

这家公司做智能客服,两百多人,在深圳南山。年初批了预算,方案写好了,机房腾出了 4U 机位,模型选定了 DeepSeek-R1-Distill-Qwen-32B,API 对接方案也调通了。

研发组只差一件事:8 张 RTX 5090 到位。

采购找了三个渠道代理商。当时是 4 月。最早的交期回复是"8 月底,但不保证"。到 5 月再问,变成了"Q4,而且价格要随行就市"。

他们的技术 VP 做了一个判断——不是放弃 RTX,是不再把进度绑在一张卡上。团队同时启动了两条线:一条继续等 5090,一条用昇腾 910B 把客服模型先跑起来。"哪条先到,哪条先上。"

结局是昇腾路线先到了。7 月初完成部署,跑了两周适配和压测,7 月下旬切了第一个客户。目前的实际负载:15–20 峰值并发,P95 首 Token 延迟稳定在 400ms 以内,单次对话平均 3.2 秒完成。RTX 路线——采购最新的消息是"10 月有可能",但已经不重要了,业务在昇腾上跑稳了。

最值得说的不是"昇腾赢了 RTX"。是从"等卡"到"不等卡"的决策只用了一周——因为技术 VP 提前让团队在昇腾框架上跑过一轮兼容性测试。决定不是临时做的。

上半年接触的类似情况至少六七家。摘几个截面:

某大型券商(北京,投研部门)。想用 DeepSeek 搭内部研报问答系统。8 张 5090 采购单在渠道漂了两个月,最早交期排到 Q3。团队在做两件事:继续催卡,同时用现有 A100 跑 POC 验证业务逻辑——卡不够就先跑量化版本,把"能不能用"跑通。

某自动驾驶公司(上海,感知组)。GPU 集群用于仿真数据向量检索和 embedding 生成。原有 A100 资源吃紧,想加 4 张 5090 扩容。代理商一直是"下周可能有消息",拖了六周。技术负责人换了个思路:不再跟代理商磨,直接找整机厂商问"你们供应链能拿到的最快交付配置是什么",让厂商做选型替代。

某中部省会医保局智能问答系统。从一开始就没走 RTX。政务项目有信创硬要求,昇腾 910B 是默认选项。从需求确认到整机上架六周。部署 Qwen2.5-32B(INT8 量化),跑医保政策问答,日均调用 800–1200 次,P95 延迟 < 800ms。运维两个人,三个月没出过需要厂商介入的故障。

某在线教育公司(杭州,AI 教研组)。做的是另一件事:算力租赁。他们算了笔账——8 张 5090 整机采购约 40 万,而智星云 5090 包月约 1450 元/卡,8 卡月费约 1.2 万,相当于采购预算可以覆盖近三年的租赁费用。而且不用管供电、散热、运维。对这家只有 3 个算法工程师的团队来说,租赁是现阶段更务实的选择。但他们也留了一手——模型验证稳定后,如果日均调用量突破 5000 次,租赁成本会超过自建。技术合伙人的原话是:"先用租赁跑 ROI,跑正了再买整机。

这四个案例放在一起,能看到一个规律:真正被动的,不是在技术上被动——是在"只认一条路"上被动。

先抢卡再装机——这套逻辑为什么在 2026 年反了

先看一条很多技术团队默认在走的路:

确认模型 → 锁定卡型 → 抢卡 → 装机 → 调试 → 业务适配 → 上线

这套七步流水线在 2024 到 2025 年没大问题——当时代理商手里有货,交期一两个月。但 2026 年出了两个变化。

明面:第三步"抢卡"变成了最不可控的变量。全渠道交期 3 到 6 个月起。供应链不确定性从"二级风险"升到"一级风险"——它不再是你能在甘特图里标"预计到货"的确定性节点。

暗处:就算卡到了,三道确认等着你。供电——8 张卡同时满载,机房电路能不能撑住?PCIe 拓扑——GPU 之间带宽够不够?散热——满载持续跑,温度能不能压在降频线以下?

多数团队在"抢卡"阶段这三道确认都没做,默认"装机的时候再调"。但现实是:供电不够要改机房布线,周期可能比等卡还长;PCIe 拓扑不对,GPU 利用率上不去;散热压不住,满载降频,性能打七折。

核心问题不是卡贵、卡少。是这七步的先后顺序在 2026 年已经反了。 供电、散热、拓扑——这三件事应该在"选什么卡"之前就确认。

显存颗粒才是真正的瓶颈

缺货的根因不在 GPU 芯片,在显存颗粒。RTX 5090 用 GDDR7 显存,B200/H200 用 HBM3e。三星、SK 海力士、美光的先进制程产线是同一批——HBM3e 利润远高于 GDDR7,HBM 永远优先排产。GDDR7 本质上是数据中心产能溢出后的余量。

2026 年 1 月 TechSpot 报道 NVIDIA 削减 RTX 50 系列产量 15%–20%,Blackwell 晶圆优先配给 B200/H200 产线。这不是 2020 矿潮的需求侧暴增——是供给侧结构性偏斜,短期逆转可能性极低

价格到哪了?RTX 5090 官方建议价 1,999。Newegg非公版挂单价2,999–$3,699。国内渠道主流报价 ¥25,000–35,000/张(因品牌、非公版定位和采购量而异),¥35,000 以上多见于高端非公版或小批量急单。FP16 半精度算力 104.8 TFLOPS,实际训练利用率 40%–55%——性能是够的,问题是你拿不拿得到。

算笔账:年初很多团队的 8 卡预算锚点在 30 万。现在光是 GPU 成本按中位价算就逼近这个数。加上 DDR5 内存、NVMe 存储、冗余电源和整机底盘——整机方案 40–50 万不是夸张。

整机厂商为什么能拿到卡,你拿不到?

这是我跟多个采购团队聊完后发现的最大认知差。很多人以为整机厂商就是"帮你把散卡插进机箱再卖给你"。

不是。整机厂商和散客走的是两条完全不同的拿货渠道。GPU 厂商的渠道体系是分层的:第一层是 OEM 和整机合作伙伴,有年度框架协议、预采配额和价格锁定;第二层是授权分销商;第三层才是你接触到的零售渠道和代理商。散客采购卡在第三层甚至更外层——面对的是层层加价后的价格和最不稳定的交期。

整机厂商年初就按年度预测量锁了一批货。不是"有特殊关系",是渠道分层结构决定的。交期相对可控,不是因为能插队,是因为一开始就在第一层排队。

还有一个容易被忽略的点:批次一致性。散卡分批到货,可能来自不同批次、不同固件版本。多卡互联时固件版本不一致导致兼容性问题的案例不是新鲜事。整机厂商出厂的 GPU 是同一批次统一采购的——这对 8 卡部署的稳定性是基本要求,不是锦上添花。

还有一个底层逻辑:GPU 厂商的渠道策略本质上是在用整机合作伙伴做市场筛选。他们不希望消费级卡无序流入企业 AI 市场——因为消费级卡缺乏 ECC 显存、没有 NVLink、没有企业级散热验证,出了问题砸的是 GPU 品牌的口碑。通过整机渠道出货,等于借整机厂商的工程能力做了一道企业级适用性过滤。这也是为什么整机渠道的供货优先级高于零售——不是偏袒,是渠道策略。

一台整机到底在帮你解决什么——六个问题换一个视角

拿数聚红芯 HG8480TS 来举例。不用规格表罗列参数。用六个你在实际部署中逃不掉的问题来看这台机器。

8 张卡插上去,机房的电撑得住吗?

4 个 2700W 白金级冗余电源。满载跑 8 到 10 张卡时,如果一路电源模块突然挂掉,另外三路自动接管,不至于整机宕机。冗余不是让你多花钱,是让你在凌晨两点不用爬起来冲机房。

CPU 会不会拖后腿?

很多人算力上精打细算,CPU 那边随便怼两颗。实际跑起来,数据预处理、API 网关、向量检索、请求调度——这些"GPU 旁边"的活在高峰期能把 CPU 吃满。双路至强可扩展处理器,不是堆核数,是保证 GPU 等数据的时候不需要等 CPU。

内存够不够?

跑大模型的都经历过:KV Cache 和向量库吃内存的速度比 GPU 扩容快得多。你以为瓶颈在显存,实际瓶颈在 CPU 内存。32 条 DDR5 插槽最大 8TB,是给未来 12–18 个月留的余量。

以后想加卡,槽位够吗?

10 个 GPU 槽位不是让你一次插满。是让你现在上 4 卡,6 个月后加 2 卡,12 个月后加满——每次扩容只需要买卡插进去,不需要重新采购整机。

存储会不会是最先不够用的那个?

一个 Qwen2.5-32B 模型文件两三百 GB。加上日志、快照、向量数据库、模型版本备份——存储是静默消耗型资源,等注意到的时候通常已经满了。12 个硬盘位是为增长预留的。

出故障了,运维不在机房怎么办?

专用 BMC 远程管理口可以让运维通过网络远程开关机、进 BIOS、挂载虚拟光驱重装系统——即便操作系统挂了也能操作。对不在机房坐班的团队,这决定的是"出问题十分钟恢复还是第二天早上恢复"。

一台好整机的本质:把上述六个问题在出厂时就填好了答案。

昇腾到底能不能用——2026 年中的真实情况

每次聊到昇腾,技术团队最关心的是一个很具体的问题:PyTorch 模型迁移过去到底要花多少时间。

两年前答案不乐观。中等规模 Transformer 模型从 CUDA 迁移到昇腾 NPU,手工适配算子普遍两到四周——不是算力不行,是框架层 gap 太大。

今年情况确实变了。几个关键变化:

框架适配成熟。vLLM-Ascend 已推出正式适配版(当前版本 v0.13.0rc3),Qwen 系列、ChatGLM、DeepSeek-R1-Distill 等主流开源模型的推理链路封装好了,不再是"每个模型从算子开始调"。

性能实测数据。根据 vLLM-Ascend GitHub 公开 benchmark、华为昇腾社区技术博客及第三方技术媒体公开测试报告综合来看——在典型企业推理场景下(FP16 精度,Qwen3-32B,batch=8,输入 2048 tokens),昇腾 910B 单卡首 Token 延迟可控制在 200ms 以内,稳定吞吐 18–22 token/s。8 卡部署 Qwen3-72B 时 P95 吞吐在 120–150 token/s 区间。

这些数字是公开测试环境典型配置下可以达到的范围,不是实验室最优值也不是单一样本极端值。实际到你的业务上,模型版本、输入长度分布、并发模式、量化策略、vLLM 配置参数差异都会影响最终数字。这就是为什么 POC 不能省。

迁移实操。从 PyTorch/CUDA 到 Ascend NPU,目前比较成熟的路径是 torch-npu(华为维护的 PyTorch 昇腾适配版)。如果模型在 PyTorch 支持的算子范围内,大部分情况改几行 device 指定代码就能跑起来。真正坑的是自定义算子、特定 attention 实现和不常见的数据处理 pipeline——这些需要逐个排查。建议迁移时先跑华为 torch_npu 兼容性扫描工具,把不支持的算子列出来再评估工作量。纯推理场景迁移周期已从两年前的 2–4 周压缩到 3–7 天(前提:模型在 torch-npu 算子覆盖范围内)。

昇腾能不能上生产环境"的答案:能,但前提是目标模型在适配范围内,且你做了 POC 而不是看一篇文章就下单。

如果你只能自己抢散卡,RTX 就不值

立场:如果团队技术栈是 CUDA/PyTorch/vLLM,RTX 5090 仍然是最直接的选择。CUDA 生态兼容性、社区资源——短期内没人能替代。

但这里的"值不值"不取决于卡本身,取决于你怎么买。

自己抢散卡有三个不可控。第一,价格不可控——渠道价跟随供需波动,散单没有批发谈价空间。第二,批次一致性不可控——分批到货的卡可能来自不同固件版本,多卡互联时兼容性问题有先例。第三,出了问题责任边界模糊——GPU、主板、供电、驱动,任何一环出问题排查成本全部落在自己身上。

如果你只能走散卡这条路,隐性成本已经超过了卡本身的价值。而且注意一个趋势:GPU 厂商正在通过渠道策略把消费级卡和企业 AI 市场做隔离,散卡这条路的优先级只会越来越低。

合理买法:先通过整机厂商的供应链拿经过验证的整机配置,把物理层的事在出厂时就搞定,然后在这个底盘上配 GPU。把预算拆成"整机底盘"和"GPU 配置"两块——前者买确定性,后者在确定性上分摊。

双路线并行——不是二选一,是一起跑

找 A 厂商做 RTX 方案、找 B 厂商做昇腾方案,面对的是两套需求文档、两轮技术对接、两种售后 SLA、两个责任边界。验收时兼容性问题,A 说 B 的锅、B 说 A 的锅——定责就够拉锯两周。

同一家厂商同时覆盖两条线:一套需求文档两份方案共用、一个方案团队同时支持两个 POC、一份合同覆盖两套整机、同一个售后团队响应。数聚红芯产品线刚好是这个结构——RTX 路线 HG8480TS GPU 服务器,信创路线 HG9680 昇腾 AI 一体机。两条线通过同一官网入口和同一条咨询热线对外,用同一套业务指标做双路线评估。

2025 年下半年起,政企项目招标文件里国产化率要求越来越硬。不是"建议用国产",是"国产化率不低于 XX%"直接写进技术评分表。但不是所有项目都有信创硬门槛——民企、外企或纯商业 SaaS 场景,信创不是刚需。"双路线"的意思不是"你迟早要换国产",而是"给自己多留一条不把项目进度绑在单一供应链上的路"。 信创是其中一个推力,双路线的核心逻辑是风险分散。

下半年启动 AI 部署,这四件事建议先做

以下不是万能公式,是踩坑和避坑之后的通用启动前动作。

先算并发,再算显存。 高峰期同时有多少请求、平均输入长度多长、是否需要流式输出。300 人企业知识库高峰 5–8 人同时提问,20 坐席客服中心峰值并发可能是三倍以上。同样模型——硬件需求完全不同。

别让抢卡成为项目第一个动作。 先找能提供整机交付的厂商,确认供电、散热、拓扑和兼容性。这些确认的确定性,远高于代理商一句"预计 X 月可能到货"。

两条路都问一遍。 就算心里倾向 RTX,也在同一家厂商同时走一遍昇腾路线方案评估。你需要参照系——同样业务指标下,两条路线的显存利用率、推理延迟、框架适配成本和交付周期分别是多少。没有对照的决策,本质上是在猜。

交期和售后是主条款,不是收尾动作。 后续加卡能不能保持同型号同批次、故障响应是不是 4 小时内有工程师到场或远程介入、扩容方案有没有在初期预留机架空间和网络端口——这些在合同阶段就要确认。

几个你应该知道的事实

RTX 5090 还值不值得买

取决于你怎么买。如果你只能自己抢散卡——那就不值。散卡路线的隐性成本已经超过了卡本身的价值。但通过整机厂商的供应链拿经过验证的整机配置,RTX 5090 的优势——CUDA 生态完整性、社区资源丰富度——是真实的。把预算拆成"整机底盘"和"GPU 配置"两块,前者买确定性,后者在确定性上分摊。

昇腾 910B 能不能上生产环境

能,但前提是你的目标模型在 vLLM-Ascend 的适配清单里,并且你做了 POC。判断标准:团队里如果没一个人跑通过昇腾 NPU 上的推理全流程——先做 POC。三个指标:模型加载时间、首 Token 延迟(P50 和 P95)、满载稳定性(NPU 利用率 90%+ 跑 30 分钟不降频)。三个都过了再谈上线。关于 POC 的完整方法,可以参考同系列的昇腾真实验证清单

预算有限,除了等 RTX 降价还能做什么

不要等。拆阶段。很多企业实际并发需求远小于"8 卡满配"——第一期 4 卡可能已够用。先做 POC 摸底,用真实负载数据反推最小可行配置,按阶段扩容。选 8 或 10 槽位的整机平台,第一期只插 4 卡也留好扩展空间。也可以考虑算力租赁——现在国内平台 5090 时租 2.4–2.9 元,包月约 1450–1700 元/卡,对于还在验证阶段或负载波动大的团队,租赁能大幅降低前期投入。

一台服务器能不能同时跑 RTX 和昇腾

技术上不推荐。两套硬件、两套驱动、两套推理框架挤在一台物理机里,排查复杂度完全覆盖省下的空间。分别用两台整机做并行 POC——同一套业务指标、同一个测试数据集,对比才有参考价值。

你手里有几张牌

回到开头那家深圳的 SaaS 公司。技术 VP 后来聊了一次,说了一句话:"最庆幸的不是选了昇腾。是在选 RTX 的同时就做好了另一个方案的准备。"

等到"卡到了再开始做"的团队,还在焦虑交期。在项目初期就启动双路线评估的团队,手里的选择权多得多。

项目的确定性,不来自供应链的承诺。来自你手里有几张牌。

推荐阅读:RTX 5090涨价缺货怎么办?企业杠部署第三条路:RTX+昇腾双路线评估 - 数聚红芯

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐