【LLM】DeepSeek V4 底层逻辑全解析:从 V3 到 V4,真正升级了什么?
DeepSeek V4 底层逻辑全解析:从 V3 到 V4,真正升级了什么?
一句话结论:DeepSeek V4 的提升不是单点突破,而是注意力、训练稳定性、工程一致性与后训练范式的组合式重构。
从 V3 到 V4,到底动了哪五刀?
2026 年 4 月 24 日,DeepSeek 发布 V4 系列预览版并同步开源,包含旗舰版 V4-Pro 与性价比版 V4-Flash 两条产品线(来源:InfoQ,2026-04)。很多人第一反应是"参数又变大了"——V4-Pro 总参数达到 1.6 万亿。
但如果只盯着参数,就会完全误判这次升级的性质。
DeepSeek V4 没有推翻 Transformer + MoE 的基本盘,而是在这个底盘上重构了五件事:长上下文效率、万亿 MoE 训练稳定性、全流程数值一致性、后训练管线,以及算力基座。最直观的收益是:在 100 万 token(1M)上下文下,V4-Pro 的单 token 推理 FLOPs 降到 V3.2 的 27%,KV Cache 只有 V3.2 的 10%(来源:DeepSeek-V4 技术报告)。
下面逐项拆开。
一、先看规格:V4 是哪两款模型?
V4 的两个版本共享同一套架构设计(CSA/HCA、mHC、Muon),区别只在层数、隐藏维度和专家数量。
| 规格项 | V4-Flash(经济型) | V4-Pro(旗舰) |
|---|---|---|
| 总参数 | 284B | 1.6T |
| 激活参数 | 13B | 49B |
| Transformer 层数 | 43 | 61 |
| 隐藏维度 | 4096 | 7168 |
| 路由专家数 | 256 | 384 |
| 每 token 激活专家 | 6 | 6 |
| 预训练数据 | 32T tokens | 33T tokens |
| 上下文长度 | 1M | 1M |
数据来源:DeepSeek-V4 技术报告;量子位,2026-04-25
这里要先分清两个概念:总参数决定知识储备上限,激活参数决定单次推理的计算成本。V4-Pro 每个 token 只点亮 6 个路由专家 + 1 个共享专家,1.6T 是"团队规模",49B 才是"每次真正开口的人"。激活比约 3.1%,比 V3 时代更激进。
二、升级点 1:CSA + HCA,让百万上下文"用得起"
长上下文的瓶颈从来不是"能不能算",而是两堵墙:算力墙(注意力复杂度 O(n²))和显存墙(KV Cache 随长度线性膨胀)。V3 系列不是做不到长上下文,而是成本太高。
V4 的解法是两种压缩注意力交错堆叠。
CSA:先粗读,再精读
CSA(压缩稀疏注意力)分三步走:
- KV 压缩:每 4 个相邻 token 的 KV 条目压成 1 条(m=4),并采用重叠压缩避免分块边界截断信息;
- 稀疏筛选:Lightning Indexer 用低精度(FP4)快速打出相关性分数,为每个 query 选出 Top-512(Flash)/ Top-1024(Pro)个压缩条目;
- 核心注意力:只在选中的压缩块上做 Multi-Query Attention。
打个比方:读一本很长的书,先看目录和摘要,再只精读最相关的章节。
HCA:更激进的全局压缩
HCA(高度压缩注意力)走向另一个极端:压缩率 m’=128,每 128 个 token 压成 1 条,且不做稀疏选择,让所有压缩条目都参与稠密注意力,负责捕捉全局走向。
两者分工清晰:CSA 管"这段在说什么",HCA 管"整篇大致往哪走"。再叠加一个 128 token 的滑动窗口分支,保证局部细粒度依赖不丢。V4-Pro 的 61 层就是 CSA 与 HCA 一层一层交替叠上去的。
效果直接:1M 上下文下 FLOPs 降至 V3.2 的 27%、KV Cache 降至 10%;若对比 BF16 GQA-8 标准基线,KV Cache 更是只剩约 2%(来源:腾讯云开发者社区技术解析)。百万上下文从"能开"变成了"用得起"。
三、升级点 2:mHC + Muon,撑起万亿 MoE
模型堆到 61 层、1.6T 参数时,传统残差连接和优化器会同时暴露问题:梯度信号衰减、训练震荡、loss 尖峰。V4 用了两项地基级改造。
mHC:给残差连接加一层数学护栏
mHC(流形约束超连接)把残差流从单路扩展为多路并行,再用一个受双随机矩阵约束(Birkhoff 多面体)的矩阵混合这些流。这个约束带来三个性质:
- 谱范数 ≤ 1——信号不会在层间被指数放大;
- 乘法封闭性——无论堆叠多少层,整体仍是非扩张的;
- 行/列和为 1——信息在传递中"守恒"。
实现上用 Sinkhorn-Knopp 迭代(20 次收敛)。听起来昂贵,但配合 fused kernel 与选择性重计算后,mHC 的墙钟时间开销仅约 6.7%(来源:技术报告)。对万亿参数模型来说,这不是"多花 6.7%“,而是"从训不出来到能训完”。
Muon:万亿参数 MoE 的优化器替换
V4 把主优化器从 AdamW 换成 Muon,仅 embedding、预测头和 Norm 等小模块保留 AdamW。Muon 的核心是先对动量矩阵做正交化(混合 Newton-Schulz 迭代近似),再更新参数,从而让各方向步长更均衡。
Muon 上一次大规模验证是 Kimi K2 的 1T MoE;V4 则是首个在万亿参数 MoE 上跑通 Muon 的模型。一句话总结这段:mHC 让信号传得稳,Muon 让模型收敛快,两者一起才撑起了 V4 的万亿 MoE。
四、升级点 3:batch invariance,用性能换可复现
这是最容易被忽略、却极重要的一条工程硬约束:同一个 token,无论被放进多大的 batch、排在什么位置、跨多少张卡,输出必须逐比特完全一致。
为什么这么极端?因为 V4 同时叠加了长上下文、复杂 MoE、FP4 量化和自研 kernel,数值不确定性的来源急剧增多。一旦训练环境与线上推理的数值对不齐,RL 训练中出现的 bug 就无法复现。
代价也很明确:团队放弃了 split-KV 等常见 GPU 优化技巧,还要为注意力解码专门设计双 kernel 来兼顾一致性与性能。这是一次典型的"用性能换可复现性"。对做后训练的团队而言,这个取舍价值极高。
五、升级点 4:OPD 专家蒸馏,不再混合训练
后训练管线是 V4 与 V3.2 最本质的方法论差异:彻底抛弃"先 SFT 再混合 RL",转向 OPD(On-Policy Distillation,同策略蒸馏)。
新管线两步走:
- 专家培养:数学、代码、Agent、指令跟随等领域各自独立做 SFT + GRPO,得到一组专精的"专家模型",并支持 Non-think / Think High / Think Max 三档推理强度;
- 模型合并:通过全词表 logits 蒸馏(而非 token 级 KL 估计)把专家能力整合进一个统一模型。
比传统方法更优的地方在于:token 级 KL 方差大、梯度不稳,而全词表 logit 蒸馏方差更低、知识保留更完整;同时反向 KL 天然起到"路由器"作用——模型遇到数学题就自动向数学专家对齐,无需外部分类器。这避免了多领域能力训练时互相打架。
六、升级点 5:算力基座从 CUDA 迁到昇腾
一个常被忽略但影响深远的底层变化:V4 的推理基座首次打通华为昇腾芯片及其 CANN 软件栈。
这意味着 DeepSeek 在 R1 时代基于 PTX 对 GPU 做的极致工程优化几乎全部作废,需要在国产硬件上重写底层代码、调度逻辑与算子体系——这也是 V4 延期半年的重要原因。
官方技术报告 3.1 节明确写道:细粒度专家并行(EP)方案在英伟达 GPU 与华为昇腾 NPU 两个平台上均完成验证。按华为公布的数据,昇腾 950 单卡跑 V4-Pro 时 Decode 吞吐可达 4700 TPS(TPOT 约 20ms,Offline 模式)。
七、一张表看懂:体感提升从哪来?
| 变化 | 技术手段 | 解决了什么 |
|---|---|---|
| 长上下文从"能开"到"能用" | CSA + HCA 混合注意力 | 把 1M 上下文的推理成本压下来 |
| 万亿 MoE 从"能堆"到"训得稳" | mHC + Muon | 解决 60+ 层深度的训练稳定性 |
| 复杂系统从"黑盒"到"可复现" | batch invariance | 预训练/后训练/推理数值严格对齐 |
| 多领域能力从"打架"到"合并" | OPD 专家蒸馏 | 数学、代码、Agent 能力统一融合 |
| 底层基座彻底重写 | CUDA → 昇腾 CANN | 摆脱单一硬件生态依赖 |
性能侧的关键数据(V4-Pro-Max):SimpleQA-Verified 57.9%(大幅领先同代开源模型)、Codeforces Elo 3206(人类选手榜第 23)、SWE-Verified 80.6%(来源:量子位,2026-04-25)。论文也坦承,在 HLE 等最前沿任务上,与顶级闭源模型仍有约 3–6 个月差距。
八、FAQ:关于 DeepSeek V4 的高频问题
Q1:DeepSeek V4 和 V3 最大的区别是什么?
A:架构层面是 CSA/HCA 混合注意力、mHC 残差改造、Muon 优化器;训练层面是 OPD 后训练范式与全流程 batch invariance。参数增长只是表象。
Q2:DeepSeek V4 的上下文窗口有多大?
A:1M(100 万)token,且 V4-Pro 与 V4-Flash 都是 1M。官方表示此后 1M 上下文将成为所有官方服务标配。
Q3:V4 支持多模态吗?
A:当前 V4 仅支持文本,不支持原生多模态,做视觉/视频任务的需另选模型。
Q4:怎么调用 DeepSeek V4 API?
A:base_url 不变,把 model 参数改为 deepseek-v4-pro 或 deepseek-v4-flash 即可;通过 reasoning_effort 参数控制思考强度(high / max)。旧模型名 deepseek-chat、deepseek-reasoner 将于 2026 年 7 月 24 日停用。
Q5:V4 是开源的吗?
A:是,权重在 HuggingFace 与 ModelScope 同步开源,采用 MIT 协议,支持 vLLM 部署。
结语:V4 的护城河,是系统工程
DeepSeek V4 的底层逻辑升级,本质上是一套系统性的效率与稳定性工程。
它没有改变大模型的基本范式:CSA/HCA 拆掉长上下文的"算力墙",mHC + Muon 拆掉万亿 MoE 的"训练墙",batch invariance 拆掉复杂系统的"工程墙",OPD 拆掉多能力融合的"效果墙"。这些升级相互耦合,才共同支撑起 V4 在百万上下文、推理效率和 Agent 能力上的综合表现。
如果只记三件事:
- CSA + HCA:让百万上下文用得起;
- mHC + Muon:让万亿 MoE 训得稳;
- OPD + batch invariance:让后训练与推理可复现、可融合。
如果这篇拆解帮你理清了 V4 的技术主线,欢迎点赞、收藏、转发给正在做模型选型的同事;关于 V4 的哪一项升级你最想深入,评论区聊——点赞最高的方向,下一篇专门展开。
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐

所有评论(0)