深度 | V4 上国芯真正的瓶颈是那张网:52% 时间在通信,互连墙卡住千亿模型

核心观点:DeepSeek V4 这个 384 专家、top-6 的千亿 MoE,被政策逼上国产芯片后,真正的瓶颈早已不是 FLOPS,而是那张 scale-up 互连网。昇腾 910C 上 52.2% 的设备时间花在通信,而文献里 all-to-all 占比是 45%–67% 的结构常量;对面英伟达的 NVLink 6 已经做到每芯片 3.6TB/s 在线带宽 + SHARP 网内归约,昇腾 UB 总线官方口径还停在「数百 GB/s」。跑得动算不完、算得快发不动——这才是国芯千亿模型的第二张墙。

证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断

封面

一、被算力叙事盖住的第二张墙

过去半年,「V4 上国芯」的讨论几乎全被两道账占据:性能账(单卡多少 FLOPS)和产能账(昇腾 950 什么时候放量)。上一期我拆了软件税——200 个算子重写、30 人年。但有一个结构性变量被系统性低估:通信

V4 是个 1.6T 总参、每 token 激活 49B 的 MoE——384 个路由专家、top-6 路由。这类模型的算力结构里藏着一个先天矛盾这类模型的算力结构里藏着一个先天矛盾:专家分布在不同的节点上,每个 token 得先把自己的数据「投递」给命中的专家(dispatch),等专家算完再把结果「汇拢」回来(combine)。这两步全对全(all-to-all)通信是串行的——计算能靠流水线藏一部分,通信的串行依赖很难藏。

通信开销有多大,多篇一手论文反复量化过:LSH-MoE(NeurIPS 2024)说 all-to-all「平均占训练时间 45%、最高 67%」,而且「不随规模缩小」;Occult(ICML 2025)等也给出「大规模训练中超过 40%」的同类结论 [B]。华为自己的生产系统论文给出了最贴近 V4 的数字:CloudMatrix384 上的 xDeepServe 测出 dispatch 平均 234 微秒、combine 312 微秒,dispatch+combine 至少占 MoE 执行时间 25%、在 decode 时延里约 36% [A]。把昨天河套-哈工大团队的 52.2% 放进去,一张「互连墙」的轮廓就清晰了。

二、技术深潜:MoE 的通信机构造,与国芯互连的物理差距

V4 用细粒度专家并行(EP)把 384 个专家铺到超节点上。以 top-6 路由为例,任何 token 都可能命中 6 个不同位置的专家——于是每个 token 至少跨节点投递一次、收拢一次。每 token 只激活 49B、总参却有 1.6T,绝大多数专家权重都「沉」在别处,token 的跨节点命中率极高。这就是为什么 EP 的 all-to-all 是「高对分带宽、高时延敏感」的持续风暴,不是偶尔一次的同步。

关键在时延而不是单纯带宽。华为论文里 XCCL 的数字暴露得很清楚:小于 1MB 的点对点时延低于 20 微秒——这已经很好。但一旦走上 all-to-all 集体路径,dispatch 就是 234 微秒、combine 是 312 微秒 [A],集体路径时延是点对点原语的 15 倍。差距不在物理链路,而在集体通信的调度与拓扑。这告诉我们的不是「加带宽就行」,而是集体效率本身才是优化的主战场。

上图:V4 的 MoE 结构把通信变成每层每 token 的一次性串行风暴,国芯互连与 NVLink 6 差约一个数量级。

打开两边的官方数据(NVLink 数字为 NVIDIA 官方 [A],昇腾 UB 为华为论文口径 [A]):

指标 NVIDIA NVLink 6 华为昇腾 UB 总线
每芯片在线带宽 3.6 TB/s(36 链路) 「数百 GB/s、比 RoCE 快数倍」
最大机架聚合 NVL72 总计 260 TB/s 无同等公开数字
网内归约 SHARP:网内 reduction/multicast XCCL 靠调度算法弥补
集体路径时延 无公开数字 dispatch 234μs / combine 312μs

最扎眼的是「网内归约」这一行。NVIDIA 的 NVLink 6 Switch 里嵌了 SHARP 引擎,把梯度归约、token 聚合做在交换芯片上,不占 GPU 计算和链路带宽;这正是今天 Hot Chips 官方披露 Rubin 时讲的「counted writes」——用计数器取代 flag-and-ack 握手,省掉同步回执流量 [A]。国产侧对应的功夫在 XCCL 的调度算法上:LocMoE(arXiv:2401.13920)在昇腾集群靠局部性感知路由,把每轮训练缩短 12.68% 到 22.24% [A]。也就是说,国芯缺网内归约硬件,只能用软件调度把伤补回一部分,补不回全部。

诚实标注一处:公众流传的「昇腾 950DT 互连 2TB/s」我没在一手来源里核实到,华为官方口径是「数百 GB/s」[C],灵衢 2.0 的具体带宽我也没有可验证的官方数字——这是本篇证据最薄的一处。若它属实,国芯 scale-up 的追赶速度比我描述的快,届时应上调判断。

三、竞争格局:互连墙决定三种路线的物理上限

剥到互连层,「V4 上国芯」其实是三种物理路线的分野。

昇腾走「封闭全栈 + 专有总线」:UB 总线、XCCL、CloudMatrix 形态都是它自己的。好处是能把 dispatch/combine 联合优化到 25%–36%(低于行业 45% 的平均线),坏处是这套东西出了华为生态就无法复用——它本质就是昇腾的「NVLink」,闭源、不可互通。

开放开源路线(UCIe、CXL、以太网/UEC)对国芯有强烈的镜像意义:中国买不到 NVLink 级的专有规模,所以国产 scale-up 天然更倾向「无损以太网 + 智能网卡/光」——阿里的 UBoE 就是这个方向的一个入口 [C]。但开放路线的代价是更低的对分带宽效率和更贵的软件栈,这正是 MoE all-to-all 最怕的。

NVIDIA 在这一层是「规则制定者」:NVLink 6 的 3.6TB/s + SHARP 把通信占比物理性往下压,这是国芯用软件调度追不上的硬差距。

上图:NVIDIA scale-up 几乎每代翻倍,而昇腾 UB 官方口径停在「数百 GB/s」,差约一个数量级。

四、市场与生态:政策把模型推上芯片,芯片却连着一张没到的网

政策端最硬的变量昨天拆过:七部委 75% 国产采购红线、9 月 1 日生效 [B]。但放到互连层看,有个被忽略的错位——政策强制的是「芯片」国产化,芯片之间那张网,优先级排在后面。买昇腾 910C 是合规项,但让这 384 片芯片真正连成一台能跑 V4 的千亿机器,靠的是 UB 总线和 XCCL,那才是华为真正锁死客户的护城河 [D]。

企业侧落地印证了这张网的价值密度。华为 CloudMatrix384 上跑的是 DeepSeek、Kimi、GLM、Qwen、MiniMax,峰值解码 2400 token/s/910C、TPOT 约 50ms [A]——当互连(UB 全对全 + 全局共享内存)到位时,国芯确实扛得起千亿推理。昨天的每日互动案例(一台八卡 Atlas 800 扛下 V4-Flash)说明:低激活率 + KV 压缩缓解的是内存带宽墙,而这张墙之外,跨节点的互连墙依然在 [B]。

token 经济和互连绑在一起。V4-Pro 定价把产能直接绑上昇腾 950 的放量节奏 [B],而放量背后真正卡的,不只是 950 芯片本身,还有让 950 连成超节点的互连和调度软件。

上图:政策把模型逼上国产芯片,但芯片间的互连层才是千亿 MoE 真正的瓶颈。

五、战略启示与我的判断

对芯片厂商:昇腾的护城河不在 FLOPS,而在那张 UB 总线 + XCCL 的互连闭环——这是寒武纪们靠 vLLM 白手套追不上的物理层壁垒 [D]。但这也是天花板:只要 UB 在线带宽还停在「数百 GB/s」,V4 这类 384 专家 MoE 的通信占比就压不进英伟达那块。

对模型厂商:V4 的架构选择(低激活率、强 KV 压缩)缓解的是内存带宽墙,对冲的却不是互连墙——all-to-all 占比是 MoE 的结构常量 [B]。所以「为国产芯片做架构适配」的下一个台阶,不在精度结构,而在能否靠专家局部性路由和通信调度把 all-to-all 流量压下去。

对采购方与投资者:政策红线把「买国芯」变成合规项,但真实性能现在多了一层变量——互连。盯数据别只盯单卡 FLOPS,要看两张墙:内存带宽墙(已被 V4 的 KV 压缩缓解)和互连墙(仍在)。信通院 AISHPerf 的集群/互连维度,会是这场核账最可能出独立数据的地方 [B]。

我判断,「V4 上国芯」的下一场仗已经从芯片转到了互连——52.2% 的通信占比说明,芯片算力到位后,网络才是新的分配器。我预判,未来一年国芯的竞争焦点会从「谁的 FLOPS 高」转向「谁的互连能把 all-to-all 压到 30% 以下」,灵衢/UBoE 的下代带宽会比芯片本身更值钱。我原以为昇腾 950DT 量产会是训练侧国产化的转折点,但把 52.2% 放进文献的 40–67% 区间看,互连带宽才是那个没被核账的隐藏变量。先不下结论:在信通院或独立第三方的集群基准出现之前,所有「千亿模型上国芯」的速度数字,都要先问一句——那是算出来的,还是通信省下来的。

参考来源(部分)

  1. NVIDIA NVLink 6 官方规格(3.6TB/s、NVL72 260TB/s、SHARP)
  2. 华为 CloudMatrix384 / xDeepServe(UB 总线、XCCL、2400tok/s,arXiv:2508.02520)
  3. LSH-MoE(all-to-all 平均 45%,NeurIPS 2024,arXiv:2411.08446)
  4. LocMoE(昇腾集群局部性路由省 12.68–22.24% 训练,arXiv:2401.13920)
  5. Hot Chips 2026:NVIDIA Rubin 官方披露(counted writes)
  6. 信通院 DeepSeek-V4 国产化适配测试(AISHPerf)

AI 辅助深度研究,人工视角解读。 每日更新。

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐