DeepSeek 私有化部署硬件选型实战:从 32B 蒸馏版到 671B 满血版双路线评估
目录
671B 还是 32B?部署 DeepSeek 的第一个决策
一个 300 人公司的场景:你先算的是什么?
假设你在帮一家 300 人的公司搭内部知识库问答系统。用的是 DeepSeek,私有化部署,数据不出公司内网。
你第一个想法可能是:先看看模型文件多大。DeepSeek-R1-Distill-Qwen-32B,BF16 精度,模型权重约 64GB。4 张 RTX 5090(每张 32GB)刚好 128GB 显存,扣掉模型权重的 64GB,还剩 64GB 给 KV Cache。看起来绰绰有余。对吧?
不对。因为漏了一个关键变量:并发。
这家公司 300 人,内网知识库不是同时用的。高峰期大概 5 到 8 个人同时提问。每个请求平均输入长度假设 2000 tokens(用户把一段合同粘贴进来问"这个条款什么意思")。KV Cache 是每层缓存的 Key-Value 对——输入越长、并发越多、模型层数越多,KV Cache 吃显存越快。
Qwen-32B 有 64 层 attention,每层为每条请求缓存 2000×64 维的 KV。64 层 × 2000 tokens × 2(K+V)× 2 bytes(FP16)× 64 维 ≈ 每条请求约 32MB。8 个并发:256MB。这看着不多。
但加上系统开销、batch padding、CUDA context 和推理引擎的预留空间——实际显存消耗通常比理论值高 30–50%。如果再来一些长文本请求(某些合同可能有 8000 tokens),KV Cache 能轻易翻几倍。
先算并发,再算显存。 这句话不是口号——是这整篇文章最核心的一条经验。
671B 还是 32B?部署 DeepSeek 的第一个决策
满血版 vs 蒸馏版:硬件成本的量级差
| 模型版本 | 参数规模 | 架构 | 最低显存需求 | 最低硬件 | 整机预算区间 |
|---|---|---|---|---|---|
| DeepSeek-R1 671B | 671B(37B激活) | MoE | ~700GB(FP8) | 8×H200 | ¥2,000,000–5,000,000 |
| DeepSeek-R1-Distill-Qwen-32B | 32B | Dense | ~64GB(BF16) | 4×RTX 5090 / 2×910B | ¥200,000–350,000 |
| DeepSeek-R1-Distill-Qwen-14B | 14B | Dense | ~28GB(BF16) | 1×RTX 5090 / 1×910B | ¥80,000–150,000 |
显存需求为模型权重 + 基础框架开销,不含 KV Cache。预算区间含整机(服务器 + GPU + 内存 + 存储 + 电源),不含机房改造。
大多数企业不需要 671B
32B 蒸馏版在客服问答、知识库检索、合同分析等常见企业场景中,效果已经足够好。671B 的 MoE 虽然更强,但每年多出来的几百万硬件和运维成本,未必能转化为等比例的业务收益。
判断标准很简单:如果你的场景是"给定文档→回答问题"(RAG)或"给定 prompt→生成固定格式输出",32B 大概率够用。如果你的场景是开放域推理、复杂数学推导、多步 Agent 决策——671B 才有必要性。
KV Cache 到底吃多少显存——两个场景的差距有多大
这是本文最硬核的部分。如果你只想看结论可以直接跳到下一章。如果你想搞清楚"为什么部署方案差这么多",这一段值得细读。
场景 A:300 人企业知识库
- 模型:Qwen-32B(64 层,4096 维 hidden size)
- 峰值并发:8
- 平均输入长度:2000 tokens
- 精度:FP16
KV Cache 估算:64 层 × 2000 tokens × 2(K+V)× 2 bytes × 4096 / 64(GQA 分组,假设 8 组)× 8 并发 ≈ 约 9GB。
加上模型权重 64GB + 推理框架预留 → 总需求约 80–90GB 显存。4 张 RTX 5090(128GB 总显存)有充足余量。2 张昇腾 910B(128GB)也够。
场景 B:20 坐席客服中心
- 模型:同样 Qwen-32B
- 峰值并发:20
- 平均输入:3000 tokens(用户可能粘贴整段聊天记录)
- 精度:FP16
KV Cache 翻了一倍不止:20 并发 × 3000 tokens(而不是 8×2000)→ 约 34GB KV Cache。
总需求:64GB + 34GB + 预留 → 约 110–120GB。4 张 RTX 5090 开始吃紧——你需要预留足够 buffer 避免 OOM。如果某些请求飙到 8000 tokens,显存可能直接爆。
两个场景,同一个模型,硬件需求差了一个等级。 这就是为什么"先算并发再算显存"不是一句正确的废话。
KV Cache 的近似值可以通过这个关系来估算:每层 attention 产生的 KV 缓存大小约等于 2 × hidden_size × 输入长度 × 精度字节数,然后乘以层数、并发数,除以 GQA 分组数。以 Qwen-32B 为例,一条 2000 token 的请求大约产生 131MB KV Cache(实际值因推理框架的 padding 策略和内存管理有 ±20% 浮动)。关键是——它不是定值,它跟并发量成正比增长。
32B 蒸馏版:两条路线的硬件配置对照
| 项目 | RTX 路线 | 昇腾路线 |
|---|---|---|
| GPU/NPU | 4–8×RTX 5090 32GB | 2–4×昇腾 910B 64GB |
| 整机平台 | HG8480TS(4U 10槽) | HG9680 昇腾一体机 |
| 推理框架 | vLLM / TensorRT-LLM | vLLM-Ascend v0.13.0rc3 |
| 量化 | FP16 或 INT8(按需) | FP16 或 INT8 |
| 整机预算 | ¥250,000–350,000 | ¥300,000–450,000 |
| 交期 | 6–12 周(取决于 GPU 供应) | 4–6 周 |
| 扩展性 | 10 槽位,后续可加卡 | 8 槽位,后续可加卡 |
昇腾整机预算偏高是因为 910B 单卡配置更高(64GB vs 32GB),2 张 910B 的总显存=4 张 RTX 5090。实际选型时按你的并发需求反推卡数,而不是简单比单价。
HG8480TS 跟 DeepSeek 部署的直接关系
部署 DeepSeek 不是你买几张卡插进任意一台机器就能跑的。HG8480TS 的几个设计点跟 DeepSeek 的场景直接挂钩:
- 4U 机箱 + 10 个 PCIe 槽位:不是让你塞满,是给你 KV Cache 增长留显卡扩容空间。今天 4 卡跑 32B 够用,6 个月后业务复杂了想换 70B,多加 2 张卡就行——不用换整机。
- 32 条 DDR5 插槽(最大 8TB):DeepSeek 的 MoE 架构在 CPU 侧有大量的 expert routing 和 KV 缓存管理开销。CPU 内存不够,GPU 空转等数据。
- 4×2700W 冗余电源:8 张 5090 满载功耗接近 4.5kW。没有冗余电源设计,半夜一个电源模块挂掉就是全机停机。
671B 满血版:部署成本不是 GPU 价格那么简单
如果业务确实需要 671B 满血版(MoE,37B 激活参数),以下是一个典型配置:
| 组件 | RTX 路线 | 昇腾路线 |
|---|---|---|
| GPU/NPU | 不推荐(显存不够) | 8–16×昇腾 910B |
| 最低显存 | ~700GB(FP8) | ~700GB(FP8) |
| 整机 | ≥2 台 HG9680 | ≥2 台 HG9680 |
| 框架 | — | vLLM-Ascend + expert parallel |
| 整机预算 | — | ¥1,200,000–2,000,000 |
| 运维要求 | — | 专职运维或厂商驻场 |
RTX 5090 的 32GB 显存跑 671B MoE 是不现实的——即使 8 张也只有 256GB,远不够 700GB 的需求。671B 的 RTX 路线实际上需要 A100/H100/H200 这类数据中心卡,而这些卡在中国市场的可得性在 2026 年已经极低。
如果你确实需要 671B 满血版,2026 年的现实选项是:昇腾 910B 多机集群,或云端 API 调用。日均调用量低于 5000 次时,云端 API 大概率比自建便宜。
五个在生产部署中高频踩坑点
别只看模型权重,忘了 KV Cache
前面第三章已经详细展开。只加一条:做容量规划时,KV Cache 预留按峰值并发的 1.5 倍算。不是浪费——是防止某天早上全员同时用导致 OOM。
PCIe 拓扑是隐藏的性能杀手
8 张卡插在一起不等于它们能高效通信。你需要确认:所有 PCIe 插槽是否直连 CPU(而非通过 PCH/南桥)、是否都跑在 x16 带宽上、是否支持 GPU Direct RDMA。这些在散卡组装方案里完全是你自己的责任——整机厂商在出厂时已做验证。
CPU 侧资源经常被忽略
DeepSeek 的 MoE 架构在推理时需要在 CPU 侧做 expert routing。如果你给 GPU 配了顶级配置但 CPU 内存只有 256GB,跑 671B 版本时 CPU 内存会先爆。CPU 内存按 GPU 总显存的 1.5–2 倍配置是基本规则。
量化不等于免费午餐
INT8 量化可以让 32B 模型的显存需求从 64GB 降到 32GB,看起来很美。但 INT8 量化后的模型精度在特定任务上(比如长文本中的细节抽取、数值计算)可能有 3–8% 的准确率下降。不能只看显存节省,不看精度损失。
部署完不是终点
模型上线第一天只是开始。后续的模型版本更新、业务负载增长、KV Cache 膨胀、多租户隔离需求——这些"运维阶段"的成本通常远超初期部署。选整机方案的好处之一:扩容、运维、故障响应有厂商兜底,不用自己扛。
关于 DeepSeek 的几个常见决策点
14B vs 32B 怎么选
如果你的场景是"检索文档→提取答案"(典型的 RAG 场景),14B 在有高质量知识库的情况下效果和 32B 差异不大。如果你需要模型做一定的推理——比如"对比这三份合同,找出条款冲突"——32B 的优势会明显体现。实用建议:先用 14B 跑 POC,效果不够再上 32B。14B 到 32B 的迁移工作量和重做差不多,不如一开始在整机上多留几个槽位。
DeepSeek-V4 出来了,部署门槛有变化吗
DeepSeek-V4-Flash(284B MoE,W8A8 量化)在 8×昇腾 910B2 上已经可以跑——GPUStack 社区实测单请求 31 token/s。门槛比 671B R1 低,但比 32B 蒸馏版高。如果你刚好处在"32B 不够用、671B 太贵"的中间地带,V4-Flash 是一个值得关注的新选项。需要 CANN ≥ 25.5 + vLLM-Ascend ≥ v0.13.0rc3。
6 个月后业务涨了,现在买的机器能撑住吗
能,前提是你选了 8 或 10 槽位的整机平台。第一期 4 卡,6 个月后加 2 卡,12 个月后加满。扩容只需要买新卡插进去——不需要重购整机。这也是为什么建议选 HG8480TS 这类可扩展平台,而不是为"当前刚好够用"去买一台 4 槽位的紧凑型机器。
速度查表:不同配置下的预期性能
| 场景 | 推荐配置 | RTX 路线预期 | 昇腾路线预期 |
|---|---|---|---|
| 14B 开发测试 | 1×5090 或 1×910B | 25–40 tok/s | 20–35 tok/s |
| 32B 知识库(低并发) | 2×5090 或 1×910B | 15–25 tok/s | 18–22 tok/s |
| 32B 客服中心(中并发) | 4–8×5090 或 2–4×910B | 80–150 tok/s(总) | 60–120 tok/s(总) |
| 72B 复杂推理 | 8×5090 或 4–8×910B | 40–80 tok/s | 50–90 tok/s |
| 671B 满血版(MoE) | 8×H200 或 8–16×910B | 需独立方案咨询 | 120–200 tok/s(总) |
性能数据为典型配置下的综合区间,具体数字取决于模型版本、量化方式、输入长度和并发模式。建议在目标硬件上做 POC 实测。
写在最后
回到开头那个 300 人公司的场景。技术负责人后来跟我说了一句话:"如果我一开始就算并发而不是算模型文件大小,就不会在第一轮选型的时候买了不够用的配置。"
DeepSeek 私有化部署里最容易犯的错误,不是参数选错了、框架选错了、硬件选错了——是顺序错了。先算并发,再算显存,然后才到选卡。
推荐阅读:
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐


所有评论(0)