多大显卡才能跑AI?AI算力GPU选型避坑策略(一张图告诉你):Deepseek等模型要求
2026年7月,Blackwell租金涨27%、H100不降反升、国产超节点量产。这篇文章帮你理清选型逻辑,不被供应商话术带偏。
2026年7月的GPU市场,核心矛盾是"有钱买不到"。
H100一年期合约从$1.70/h涨到$2.35/h,涨了40%。Blackwell租金年初至今涨27%。千卡级订单交付周期12-15个月,排期到2027-2028年。更反常的是,H100在B200量产后没降价——需求增速超过了供给增速。
卖方市场。选错卡的代价比平时大得多。
直接讲选型逻辑,核心就三点:显存、带宽、互联——按这个顺序做决策,供应商的话术基本骗不到你。
为什么显存是第一优先级
模型放不进显存,一切免谈。不管算力多高、带宽多大,显存不够就是跑不了。
推理场景的显存需求:模型权重 + KV Cache + 框架开销(1-2GB)。训练场景更夸张,7B模型全参训练静态需~112GB,单张A100-80G跑不动。70B全参训练Llama2用了2048张A100,35天。
选卡第一步:算出你的模型需要多少显存。
带宽比算力更能预测推理性能
LLM推理本质上是Memory-Bound,不是Compute-Bound。算术强度极低(~10-50 FLOPS/Byte),GPU算力利用率经常只有30-50%。自回归解码每生成1个token,要把整个模型权重从显存读一遍。
7B模型BF16(14GB)÷ H100带宽3.35TB/s ≈ 240 tok/s理论上限。换到RTX 4090(1TB/s)→ 70 tok/s。
H200和H100算力完全相同(989 TFLOPS),但H200带宽4.8TB/s、H100只有3.35TB/s。H200在推理场景下比H100快得多——算力没变,带宽高了43%。

NVLink决定多卡训练的可行性
PCIe 4.0 x16双向带宽~64GB/s,NVLink5(B200)是1.8TB/s,差28倍。多卡训练时通信开销占40-60%,PCIe互联下GPU大部分时间在等数据。
中国特供版的阉割核心就在互联:A800的NVLink从600GB/s砍到400GB/s,H800从900GB/s砍到400GB/s。算力没变,多卡效率大幅下降。
(有帮助请点个关注,谢谢!)




单卡部署能力矩阵
给定模型参数量,快速判断最低硬件门槛:
| GPU | BF16推理 | INT8/FP8 | INT4量化 |
|---|---|---|---|
| RTX 4090-24G | ~13B(7B舒适) | ~20-26B | ~40-48B |
| A100-80G | ~34-40B | ~65-70B | ~130-150B |
| H100-80G | ~38-45B | ~70-75B | ~140-160B |
| H200-141G | ~65-75B | ~120-130B | ~250-270B |
| MI300X-192G | ~85-95B | ~160-180B | ~340-380B |
| B200-192G | ~90-100B | ~170-180B(FP8) | ~360-400B |
注意:RTX 4090跑70B INT4速度仅8-10 tok/s,基本不可用于生产。长上下文(32K-128K)下KV Cache可吃掉30-50%显存,标称"可运行XX模型"可能在长上下文下OOM。INT4量化在数学推理/代码任务上精度损失明显,业务关键场景建议用FP8/INT8。
MoE模型有一个特殊陷阱:必须按总参数计算显存,不是按激活参数。DeepSeek-V3总参数671B,激活参数仅37B——但推理时仍需加载全部专家参数。BF16下~1.4TB,FP8下~700GB。供应商用"37B激活参数"宣传时,你需要追问EP并行度、单卡需加载多少专家参数。
以下为2026年7月经验参考,FP16/BF16精度(未量化):
| 模型规模 | 推理最小配置 | 全参微调 | 从头训练 | 推荐卡型 |
|---|---|---|---|---|
| 7B – 13B | 1卡(24GB+) | 4–8卡 | 32–64卡 | 4090 / L40S / A10 |
| 34B – 70B | 2–4卡 | 8–16卡 | 128–256卡 | A100 80G / H100 |
| 70B – 130B Dense | 8–16卡 | 32–64卡 | 256–512卡 | A100/H100 SXM |
| 400B+ / MoE | 64–128卡 | — | 256–2048卡 | H100/H200/B200 |
| DeepSeek-V3 (671B MoE) | 16×H200 | — | 2048×H800×55天 | H800/H200集群 |
MoE模型注意按总参数算显存。DeepSeek-V3激活参数仅37B,但推理时需加载全部671B参数到显存。
供应商最常混淆的10个参数点
1. 稀疏算力冒充稠密——H100 FP16"1979 TF"是稀疏值,稠密仅989TF,虚报2倍。稀疏加速需要模型和框架支持,大部分业务场景用不到。
2. SXM vs PCIe 形态陷阱——H100 SXM带宽3.35TB/s,PCIe仅2.0TB/s(-40%)。供应商不说形态就是陷阱。
3. 特供版不说明阉割点——只说"合规版H系列"。A800/H800砍互联,H20砍算力85%,各有不同。需要追问具体型号和阉割参数。
4. FP8支持差异——A100和昇腾910B"支持FP8"是软件模拟,没有实际硬件加速。FP8是Transformer Engine硬件原生还是软件模拟?实际加速比多少?
5. PCIe冒充SXM——"供应H100 8卡服务器"但不标注形态,PCIe版无NVSwitch全互联,多卡训练效率大降。
6. "单卡跑70B/671B"——通常是INT4量化或MoE按激活参数宣传。是BF16还是INT4?精度损失评测数据?MoE按总参数还是激活参数?
7. 低价引流+隐性收费——单卡时租低,通过带宽/存储/跨AZ/支持订阅收费,全周期可高15-28%。需要全口径TCO报价。
8. 隐性费用清单——数据传出$0.08-0.12/GB、跨AZ流量、块存储~$0.08/GB/月、企业支持订阅月消费3-10%,这些常被排除在报价外。
9. MoE激活参数误导——"DeepSeek-V3仅37B激活参数,单卡可运行"。推理仍需加载全部671B参数。需要追问EP并行度。
10. 精度口径漂移——B200给出FP8稀疏9PF,与H100的FP16稠密989TF对比,同时切换精度和稀疏口径。
价格参考与出口管制矩阵
| 型号 | 整机参考价(¥万) | 交付周期 |
|---|---|---|
| 8×H100 80G SXM | 230–280 | 8–12周 |
| 8×H200 141G SXM | 260–320 | 12–16周 |
| 8×B200 192G SXM (OEM) | 290–350 | 12–15个月(排至2027) |
| DGX B200(官方交钥匙) | 374($51.5万) | 12–15个月 |
| GB200 NVL72(72卡整机柜) | 2200–2800($300–390万) | 12–15个月 |
| 8×H20 96G SXM | 110–140 | 现货 |
| 8×MI300X OAM | 180–240 | 需询价 |
| 8×昇腾910B(鲲鹏平台) | 170–210 | 4–8周 |
| 8×昇腾910C超节点 | 280–350 | 现货紧张 |
| 8×RTX 4090 PCIe | 28–40 | 现货 |
出口管制矩阵
| 管制等级 | 型号 | 对华出口 |
|---|---|---|
| 严格管制 | H100/H200/B200/GB200/MI300X | 禁运,需许可 |
| 合规特供 | H20/A800/H800 | 合规,算力阉割至阈值 |
| 部分受限 | L40S/L20/RTX 4090 | 部分地区限制 |
| 国产替代 | 昇腾910B/910C、寒武纪590 | 无管制 |
云租赁价格分化极大。H100按需$2-14/h,一年期预留可比按需省30-40%,3年省55-72%。社区GPU云(Vast.ai/RunPod)$1.47-2.69/h,但SLA弱、不适合关键业务。MI300X在RunPod仅$0.50/h、192GB显存,推理/微调场景性价比极高。
国内平台(AutoDL等)RTX 4090约¥0.6-0.8/h,H100约¥12-20/h。2026年4月阿里云、百度智能云AI算力提价5-34%。
历史参照:A100在H100上市后没有大幅降价,反而因需求爆发上涨。H100第二年残值率约85%(传统IT硬件反常识)。推断H100在B200量产后从"顶配训练卡"降级为"推理/中端训练卡",价格受推理需求支撑维持高位。
三股势力
NVIDIA(~90%份额):CUDA生态壁垒极高,但变化在发生。Anthropic用Claude一周末完成AMD MI355芯片适配。DeepSeek梁文锋:CUDA护城河正在被AI快速瓦解。产品路线:B300(2025H2出货)→ Rubin R100(2026H2预计),HBM4+NVLink6,训练3.3-3.5x/推理5x/带宽2.8x。注意B300生命周期较短,大规模采购存在快速迭代风险。
AMD(性价比突出):MI300X在RunPod仅$0.50/h、192GB显存。MI350X(288GB HBM3e, $3.18/GPU/h)。新发布MI455X(2nm, 432GB HBM4, 40PFLOPS FP4)。PyTorch已原生支持ROCm,推理/微调性价比极高。制约:ROCm生态成熟度仍不及CUDA,大规模训练部署规模远小于NVIDIA。
国产昇腾(追赶中):910C(128GB HBM3, ~400TF FP16)MoE推理系统效率4.45 tok/s/TFLOPS,超过H100 SGLang的3.75——但这是MoE+EP+系统级优化,非单卡训练性能。CloudMatrix 384已商用750+套。训练MFU稳定在30-34.9%。差距:单卡性能与B200仍有2.5-5倍差距(视场景),CANN vs CUDA生态迁移成本高,7nm良率(约40%)和HBM3国产化进度制约产能。
当前市场环境下的决策优先级
锁产能 > 砍价。卖方市场核心矛盾是"有钱买不到",优先锁定未来6-12个月配额。
交付SLA和罚则 > 单价。延期1个月的损失远超单价10%的折扣。千卡级交付周期12-15个月,没有延期罚则供应商没有动力按时交付。
价格重定条款 > 锁价。2026H2-2027年可能出现供给拐点(Rubin+Blackwell放量)。长期合约需价格保护机制,否则可能被锁在高位。
技术置换权 > 当前型号。Rubin发布可能加速B200贬值。合同中争取补差价升级新一代GPU的权利。
推理需求已超过训练,成为算力消耗主引擎。花旗数据:LLM Token总量环比+70%,同比20倍。推理优化价值——高带宽、大显存——比以往任何时候都大。
出口管制方面:H20纳入管制后2025年7月恢复对华销售,但合规大排查导致亚洲白名单企业砍半以上。H200对华首批发货量仅"个位数"。B20A(特供版B200)尚未规模出货。建议受管制实体建立国产算力备选方案。
选卡没有标准答案,但有标准问题:显存够不够?带宽够不够?互联要不要?把这三个问题按顺序问一遍
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐


所有评论(0)