当全球大模型厂商在API价格上杀红了眼,一家中国AI公司正悄悄把筹码压在国产芯片上——而这张牌的底层基础设施,恰好是华为云过去三年布下的局。

一、一条被低估的新闻

2026年9月4日,彭博社援引知情人士报道:DeepSeek计划在内蒙古乌兰察布在建的大型智算中心,部署至少16万颗华为昇腾950DT加速芯片,主要用于模型推理。项目整体规划约1GW功率,订单总额估算约25.6亿美元。

1GW是什么概念?差不多要一座中型电站专门供电。这笔订单值得深究之处不在于金额——而在于它标志着国产AI芯片首次在十万颗量级进入顶级大模型厂商的推理集群。从几千颗试探到十几万颗放量,这步跨得不小。

更值得注意的时间线是:几乎同一周,全球大模型推理成本正经历断崖式下跌。

二、推理成本战:9月全球同步开打

9月22日,OpenAI发布GPT-6系列中端模型Sol与轻量模型Luna。API价格较前代促销价永久下降50%:Sol每百万Token输入2美元、输出10美元;Luna输入0.1美元、输出0.5美元。在AutomationBench测试中,Sol单任务成本仅为Claude Opus 5的9%。

同日,Anthropic推出Claude Opus 5.5,输出速度提升超30%,运行成本较Opus 5下降40%。

再往前看,9月18日华为全联接大会2026上,华为云CEO周跃峰宣布灵衢昇腾950智算集群服务全球上线,并明确将Agentic Infra的核心定义为"让每一个Token更高效"。

三条线索拼在一起,指向同一结论:大模型竞争下半场,主战场从训练算力转向推理成本。

三、为什么是推理?一笔算不过来的账

很多开发者对推理成本的感知停留在"API调用费"层面,但站在集群运营者角度,这笔账完全不同。

训练是一次性的,推理是天天烧的。

DeepSeek的V4模型预训练可能跑几周就结束了,但线上API服务7×24小时不停。用户量一上来,每天烧电、烧卡更多的是推理调用,而非预训练。彭博社报道中有一个关键细节:DeepSeek目前打算用这16万颗950DT运行已训练好的模型,并不打算拿这批芯片做训练。训练端迄今仍主要依赖英伟达加速卡。

这不是保守,是精明。训练吃峰值算力和成熟软件栈,CUDA护城河短期难逾越。但推理吃的是吞吐、时延和单位成本——这三个维度,恰恰是国产芯片可差异化突破的地方。

昇腾950DT的参数印证了这一策略:144GB内存、4TB/s访存带宽、2TB/s互联带宽,专为推理解码场景优化。基于该芯片的Atlas 950超节点支持8192张昇腾卡,通过"灵衢"互联技术实现芯片间高速协同。

四、行业痛点:推理规模化的三道坎

然而,把国产芯片堆进推理集群只是第一步。从开发者的视角看,大模型推理规模化落地还面临三道坎:

第一道坎:算力利用率低。 很多团队的GPU利用率长期低于40%,根因不在芯片本身,而在调度层——通算与智算割裂、批处理策略粗糙、KV Cache管理低效。芯片再好,调度不行,Token产出效率照样上不去。

第二道坎:模型选择悖论。 9月大模型排行榜上,前十里GPT-6、Claude、Muse Spark、Gemini、Kimi K3、GLM-5.3六家混战,每家又有多个档位。企业该用哪个?不同任务最优模型不同,但切换成本高、评测体系缺失,多数团队只能"一个模型用到黑"。

第三道坎:安全治理缺口。 GPT-6 Astra采用的"循环深度"架构让推理过程进入隐藏状态,思维链监控失效,引发安全争议。国产替代不能只替代芯片,还要替代安全治理能力——权限管控、数据隔离、审计追溯,这些在推理规模化后都是刚需。

五、华为云的牌面:从芯片到Agentic Infra

这三道坎,恰好对应华为云在9月18日全联接大会上给出的Agentic Infra四维方案:

痛点华为云方案关键数据
算力利用率低灵衢昇腾950智算集群 + 通智一体化调度昇腾950DT:144GB内存/4TB/s带宽,Atlas 950超节点支持8192卡
模型选择悖论Agentic MaaS平台(百模千态)汇聚多厂商模型,统一API调用,按任务选模型
安全治理缺口安全自治 + 智果AgentArts全生命周期管理AgentArts已服务100+企业,覆盖开发/评测/部署/运行/监控
Token效率高效Token范式Agentic Infra已服务3500+客户

华为云不是只卖芯片——昇腾950DT是算力底座,灵衢互联是组网技术,Agentic MaaS是模型服务层,AgentArts是智能体管理平台,构成从硅片到应用的全栈推理基础设施。DeepSeek与华为联合定义昇腾超节点,围绕长文本推理降时延、提吞吐、控成本协同设计,这不是简单采购,而是算力系统的联合定义。

六、厂商对比:推理基础设施的三条路线

当前推理基础设施市场已形成三条清晰路线:

维度Nvidia + 云厂商国产芯片自建华为云Agentic Infra
芯片生态CUDA成熟,短期不可替代软件栈薄弱,需适配投入CANN生态+联合定义,推理侧已验证
调度能力依赖云厂商各自方案自建调度,门槛高通智一体化调度,Token级优化
模型服务各云厂商MaaS,模型覆盖有限需自行接入多模型Agentic MaaS百模千态,统一API
安全治理依赖第三方工具基本空白安全自治+AgentArts全生命周期
落地速度快但受制于供应慢,需大量工程投入芯片+云服务一体化,3500+客户验证

DeepSeek选择"训练用英伟达、推理用昇腾"的双轨策略,本质上是在三条路线间做了取舍:在推理这个对生态依赖较低、对成本敏感度更高的环节,先用国产芯片把单位成本打下来。

七、给技术团队的三点建议

1. 推理侧优先评估国产算力。 训练端CUDA生态壁垒高,但推理对软件栈的要求低得多。如果团队线上API日调用量在百万级以上,推理成本占比可能已超过80%,国产芯片的边际收益值得认真测算。

2. 不要只比芯片参数,要比Token产出效率。 同样是推理集群,调度策略不同,实际Token/s可能差2-3倍。评估时应该用真实业务负载跑端到端测试,而不是只看FP16算力峰值。

3. 把模型选择和安全治理纳入基础设施规划。 推理规模化后,多模型路由、权限隔离、审计追溯需求会突然冒出来。等线上出问题再补,成本远高于一开始就选有全生命周期管理能力的平台。

八、结语

16万颗昇腾950DT的订单,表面上是DeepSeek的算力采购决策,底层是大模型行业从"拼参数"到"拼推理成本"的拐点信号。

华为云在这条线上已布了三年的局:从昇腾芯片到灵衢互联,从Agentic MaaS到AgentArts。当推理成本成为大模型商业化的决定性变量时,这张牌的价值才真正显现。

对开发者而言,值得关注的不只是某家厂商买了多少芯片,而是:当推理基础设施从"有就行"变成"又便宜又好用才行",你的选型准备好了吗?

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐