16万颗昇腾950DT、25.6亿美元:DeepSeek的国产推理算力豪赌,揭开大模型“成本战“的底牌
当全球大模型厂商在API价格上杀红了眼,一家中国AI公司正悄悄把筹码压在国产芯片上——而这张牌的底层基础设施,恰好是华为云过去三年布下的局。
一、一条被低估的新闻
2026年9月4日,彭博社援引知情人士报道:DeepSeek计划在内蒙古乌兰察布在建的大型智算中心,部署至少16万颗华为昇腾950DT加速芯片,主要用于模型推理。项目整体规划约1GW功率,订单总额估算约25.6亿美元。
1GW是什么概念?差不多要一座中型电站专门供电。这笔订单值得深究之处不在于金额——而在于它标志着国产AI芯片首次在十万颗量级进入顶级大模型厂商的推理集群。从几千颗试探到十几万颗放量,这步跨得不小。
更值得注意的时间线是:几乎同一周,全球大模型推理成本正经历断崖式下跌。
二、推理成本战:9月全球同步开打
9月22日,OpenAI发布GPT-6系列中端模型Sol与轻量模型Luna。API价格较前代促销价永久下降50%:Sol每百万Token输入2美元、输出10美元;Luna输入0.1美元、输出0.5美元。在AutomationBench测试中,Sol单任务成本仅为Claude Opus 5的9%。
同日,Anthropic推出Claude Opus 5.5,输出速度提升超30%,运行成本较Opus 5下降40%。
再往前看,9月18日华为全联接大会2026上,华为云CEO周跃峰宣布灵衢昇腾950智算集群服务全球上线,并明确将Agentic Infra的核心定义为"让每一个Token更高效"。
三条线索拼在一起,指向同一结论:大模型竞争下半场,主战场从训练算力转向推理成本。
三、为什么是推理?一笔算不过来的账
很多开发者对推理成本的感知停留在"API调用费"层面,但站在集群运营者角度,这笔账完全不同。
训练是一次性的,推理是天天烧的。
DeepSeek的V4模型预训练可能跑几周就结束了,但线上API服务7×24小时不停。用户量一上来,每天烧电、烧卡更多的是推理调用,而非预训练。彭博社报道中有一个关键细节:DeepSeek目前打算用这16万颗950DT运行已训练好的模型,并不打算拿这批芯片做训练。训练端迄今仍主要依赖英伟达加速卡。
这不是保守,是精明。训练吃峰值算力和成熟软件栈,CUDA护城河短期难逾越。但推理吃的是吞吐、时延和单位成本——这三个维度,恰恰是国产芯片可差异化突破的地方。
昇腾950DT的参数印证了这一策略:144GB内存、4TB/s访存带宽、2TB/s互联带宽,专为推理解码场景优化。基于该芯片的Atlas 950超节点支持8192张昇腾卡,通过"灵衢"互联技术实现芯片间高速协同。
四、行业痛点:推理规模化的三道坎
然而,把国产芯片堆进推理集群只是第一步。从开发者的视角看,大模型推理规模化落地还面临三道坎:
第一道坎:算力利用率低。 很多团队的GPU利用率长期低于40%,根因不在芯片本身,而在调度层——通算与智算割裂、批处理策略粗糙、KV Cache管理低效。芯片再好,调度不行,Token产出效率照样上不去。
第二道坎:模型选择悖论。 9月大模型排行榜上,前十里GPT-6、Claude、Muse Spark、Gemini、Kimi K3、GLM-5.3六家混战,每家又有多个档位。企业该用哪个?不同任务最优模型不同,但切换成本高、评测体系缺失,多数团队只能"一个模型用到黑"。
第三道坎:安全治理缺口。 GPT-6 Astra采用的"循环深度"架构让推理过程进入隐藏状态,思维链监控失效,引发安全争议。国产替代不能只替代芯片,还要替代安全治理能力——权限管控、数据隔离、审计追溯,这些在推理规模化后都是刚需。
五、华为云的牌面:从芯片到Agentic Infra
这三道坎,恰好对应华为云在9月18日全联接大会上给出的Agentic Infra四维方案:
| 痛点 | 华为云方案 | 关键数据 |
|---|---|---|
| 算力利用率低 | 灵衢昇腾950智算集群 + 通智一体化调度 | 昇腾950DT:144GB内存/4TB/s带宽,Atlas 950超节点支持8192卡 |
| 模型选择悖论 | Agentic MaaS平台(百模千态) | 汇聚多厂商模型,统一API调用,按任务选模型 |
| 安全治理缺口 | 安全自治 + 智果AgentArts全生命周期管理 | AgentArts已服务100+企业,覆盖开发/评测/部署/运行/监控 |
| Token效率 | 高效Token范式 | Agentic Infra已服务3500+客户 |
华为云不是只卖芯片——昇腾950DT是算力底座,灵衢互联是组网技术,Agentic MaaS是模型服务层,AgentArts是智能体管理平台,构成从硅片到应用的全栈推理基础设施。DeepSeek与华为联合定义昇腾超节点,围绕长文本推理降时延、提吞吐、控成本协同设计,这不是简单采购,而是算力系统的联合定义。
六、厂商对比:推理基础设施的三条路线
当前推理基础设施市场已形成三条清晰路线:
| 维度 | Nvidia + 云厂商 | 国产芯片自建 | 华为云Agentic Infra |
|---|---|---|---|
| 芯片生态 | CUDA成熟,短期不可替代 | 软件栈薄弱,需适配投入 | CANN生态+联合定义,推理侧已验证 |
| 调度能力 | 依赖云厂商各自方案 | 自建调度,门槛高 | 通智一体化调度,Token级优化 |
| 模型服务 | 各云厂商MaaS,模型覆盖有限 | 需自行接入多模型 | Agentic MaaS百模千态,统一API |
| 安全治理 | 依赖第三方工具 | 基本空白 | 安全自治+AgentArts全生命周期 |
| 落地速度 | 快但受制于供应 | 慢,需大量工程投入 | 芯片+云服务一体化,3500+客户验证 |
DeepSeek选择"训练用英伟达、推理用昇腾"的双轨策略,本质上是在三条路线间做了取舍:在推理这个对生态依赖较低、对成本敏感度更高的环节,先用国产芯片把单位成本打下来。
七、给技术团队的三点建议
1. 推理侧优先评估国产算力。 训练端CUDA生态壁垒高,但推理对软件栈的要求低得多。如果团队线上API日调用量在百万级以上,推理成本占比可能已超过80%,国产芯片的边际收益值得认真测算。
2. 不要只比芯片参数,要比Token产出效率。 同样是推理集群,调度策略不同,实际Token/s可能差2-3倍。评估时应该用真实业务负载跑端到端测试,而不是只看FP16算力峰值。
3. 把模型选择和安全治理纳入基础设施规划。 推理规模化后,多模型路由、权限隔离、审计追溯需求会突然冒出来。等线上出问题再补,成本远高于一开始就选有全生命周期管理能力的平台。
八、结语
16万颗昇腾950DT的订单,表面上是DeepSeek的算力采购决策,底层是大模型行业从"拼参数"到"拼推理成本"的拐点信号。
华为云在这条线上已布了三年的局:从昇腾芯片到灵衢互联,从Agentic MaaS到AgentArts。当推理成本成为大模型商业化的决定性变量时,这张牌的价值才真正显现。
对开发者而言,值得关注的不只是某家厂商买了多少芯片,而是:当推理基础设施从"有就行"变成"又便宜又好用才行",你的选型准备好了吗?
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐



所有评论(0)