Day0开源发布:CANN解锁Kimi K3昇腾NPU部署实践
2026年7月27日,Moonshot AI发布了新一代Kimi K3模型开源权重。该模型为目前已知参数量最大的开源模型,参数规模达2.8万亿,进一步提升了大模型复杂任务的处理能力。昇腾CANN对模型 MXFP4 量化实现Day0原生支持,并提供在昇腾950PR/DT系列和Atlas A3系列集群部署实践,现已面向开发者开源推理代码和算子实现。
Kimi K3采用2.8T参数的混合注意力MoE 架构,模型交错使用Kimi Delta Attention(KDA)与 Gated MLA,并引入Attention Residuals(AttnRes)和Stable LatentMoE。线性注意力 KDA 维护固定大小的序列状态,支持模型处理超长序列,缓解标准注意力机制存在的计算 / 存储成本。AttnRes 替代残差连接,沿网络深度聚合历史表示,带来稳定的扩展增益。
为实现超大参数规模Kimi K3模型部署及上述新特性,CANN社区随模型权重开源同步提供昇腾 NPU 部署方案与开源实现。
-
提供950PR/DT4机32卡部署方案,采用Embedding TP、Attention DP/TP、Dense TP、Routed Expert EP、Prefill SP 与 Decode DP的混合部署策略,满足超大参数模型的内存切分需求,并充分发挥集群并行计算能力。
-
针对2.8T超大参数规模,支持Kimi K3原生MXFP4量化模式,路由专家直接使用模型原生的MXFP4权重与动态MXFP8激活进行推理,无需额外量化转换,有效降低大规模专家权重的存储与访存开销。
-
Kimi K3 896 专家的大 EP 部署场景,能够充分发挥昇腾超节点架构优势。相较前代模型,Kimi K3专家规模显著提升,通信交互复杂度同步增长,超节点互联能力充分匹配其海量专家并行的通信负载特征,由 AIV 直接下发 UB Memory 通信任务,有效抬升 MoE 推理吞吐上限。
-
模型集成多个融合算子,包括Recurrent KDA 与 Conv1D fn / update,Stable LatentMoE 采用 Combine 与 MXFP8 Dispatch 大EP算子,以及Gated MLA的KV Cache更新融合算子 与 FIA 算子,助力进一步性能优化。
同时,趋境科技基于开源推理引擎 SGLang 完成了Kimi K3在昇腾 Atlas A3 上的Day0推理适配。项目实现 KDA 的昇腾CANN适配,并针对 MoE、混合注意力机制、多卡通信等关键模块进行了优化,实现模型在昇腾平台上的高效、稳定运行。相关适配成果即将开源,为开源大模型在昇腾平台上的快速部署和Agent应用落地提供有力支撑。
昇腾950全系列、Atlas A3产品支持Kimi K3部署。昇腾始终致力于为世界提供新选择,以极致算力、开放生态赋能AI创新,期待联合客户与开发者,依托 Kimi K3 探索 AI 无限可能。
后续还将进一步支持优化特性:
-
KDA 算子优化:提供 KDA Prefill 融合算子,进一步降低 TTFT(首 Token 响应时延);优化KDA Decode融合算子,持续改善吞吐与时延指标;
-
基于Two-Phase计算策略,提供AttnRes融合算子,减少中间张量读写与任务调度开销;
-
MegaMoE融合算子:面向 896 专家MoE大EP多专家部署场景,落地 MegaKernel 融合方案,全面提升推理吞吐与运行稳定性。
Kimi K3昇腾 NPU 推理优化实践:
https://gitcode.com/cann/cann-recipes-infer/tree/master/docs/models/kimi_k3/kimi_k3_inference_guide.md
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐


所有评论(0)