昇腾0day支持Kimi K3的训练适配及推理部署,解锁万亿MoE大模型高效训推新范式
2026年7月27日,月之暗面正式开源Kimi K3。该模型总参数量达2.8万亿,是全球首个开源的3万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。模型基于KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有100万token上下文窗口,在保持顶尖能力的同时,将KV Cache压缩75%,长上下文解码速度最高提升6.3倍,大幅优化了训练与推理的效率及成本。
此次Kimi K3一经开源发布,昇腾即实现0day极速适配:在训练侧,基于MindSpeed MM在Atlas 800 A3、Atlas 900 A3 SuperPoD上完成减层训练基础功能适配,在算子、并行加速、显存优化等方面进行专项优化;在推理侧,通过vLLM Ascend与 SGLang开源推理引擎实现快速部署,同时,昇腾950超节点支持FP8、MXFP8、MXFP4等全系列数值精度格式,原生支持Kimi K3的mxFP4量化权重。
Kimi K3——面向长程智能体的开源旗舰大模型
Kimi K3以2.8万亿参数,成为全球首个开源的3万亿级模型。借助Stable LatentMoE架构与精准路由,模型在保持庞大知识容量的同时,可以在896个专家中高效激活16个参与计算。这种“总参巨大、按需调用”的设计,让它在承接顶级复杂任务的同时,将推理成本压缩至开源友好区间,相较前代扩展效率跃升2.5倍。
依托KDA混合注意力与Attention Residuals,K3将百万级上下文的解码速度提升6.3倍,显存占用大幅缩减。这让模型能够跨越数十万行代码保持逻辑连贯,在极少干预下独立完成48小时芯片设计、从零构建编译器内核,并能通过“截图-推理”闭环自主修正前端界面与CAD图纸,具备完整的工程交付意识。
凭借对海量文献与数据的吞吐能力,K3将知识工作从“问答”推向“交付”。无论是2小时复现复杂的物理定律,还是梳理横跨42年的产业变迁,模型都能交叉验证数据源,产出包含交互图表与深度分析的可视化报告。配合Kimi Work的动态看板,AI生成的洞察成为可追溯、可迭代的数字资产。
技术优势延伸至系统底层。训练端采用SiTU激活与完全均衡的专家并行,适配 64+加速器集群,消除通信瓶颈;推理端贡献了KDA Prefix-Cache技术,在编程场景中实现超90%的缓存命中率,将输入成本降至每百万Token仅2元,让高性能AI真正成为高频使用的生产力基础设施。
基于昇腾实现Kimi K3训练基础功能适配与深度优化
Kimi K3采用KDA混合线性注意力与896专家Stable LatentMoE 架构以及1M上下文,高性能训练面临核心挑战:KDA混合算子递归与局部计算交织影响计算密度;896路专家高稀疏度与<2%激活率易引发专家负载不均衡;2.8T参数规模带来极致的显存墙限制。昇腾MindSpeed MM多模态模型套件依托FSDP后端支持、MoE专项优化、分块损失计算、FLA Triton加速及meta-device虚拟初始化等核心特性,基于A3单机加载随机权重完成训练基础功能适配,高效支撑Kimi K3模型的一键部署与稳定高效训练。
MindSpeed MM推出FSDP+EP+CP多维并行框架,解耦并行与架构,兼容多硬件,融合算子优化与显存管理,大幅提升训练效率。
Kimi K3模型采用大参数稀疏MoE架构,内置896个专家,面对海量专家参数使用FSDP框架进行训练时易导致OOM问题。MindSpeed MM引入了EP(专家并行)+FSDP的混合并行策略,通过将专家参数切分至不同加速卡(rank)。单个加速卡上allGather权重量显著降低,减小训练过程中的单卡显存峰值占用。

图示:FSDP+EP示意图
基于MindSpeed MM新训练后端,实现天级适配新模型,提供“开箱即用、快速迭代”的开发体验,为多模态大模型的研究与应用提供了强有力的技术支撑。
Kimi K3模型作为大参数稀疏MoE模型,隐藏层高,专家数多,语言模块的计算量高、耗时大,即使对于短序列数据,训练时间也较长,成为大规模MoE模型训练性能瓶颈。MindSpeed MM采用GEMM(group expert matmul)技术提升模型计算速度,torch_npu.npu_grouped_matmul 是昇腾CANN专为大规模MoE模型优化的高效算子,其核心思路是将多个独立的矩阵乘法操作(matmul)进行批量化、分组化处理,通过减少内存访问开销和计算调度开销,显著提升大模型训练与推理效率。

图示:GEMM示意图
Kimi K3模型中约四分之三的attention block使用了线性注意力层,提升线性注意力层的计算性能是昇腾训练加速的关键。MindSpeed MM基于昇腾自研Triton Ascend编译框架和BiSheng编译器,利用CV算子融合、流水编排、访存优化等关键技术,提升线性注意力层的计算性能。

图示:Triton-Ascend 架构
Kimi K3模型词表大小vocab_size远大于模型的隐藏层维度hidden_size,在损失计算时会带来显著的显存峰值,且序列越长,峰值越明显,在动态shape场景下还易引发大块内存碎片,显存压力更大。MindSpeed MM在采用FSDP2混合并行策略的基础上采用ChunkLoss进一步降低峰值显存,通过对序列维度进行分块(chunking),将loss计算拆分为多个长度为sub_seq子段依次进行。在完成每个子段的前向计算后,立即执行对应的反向传播,从而避免同时保留整个序列的logits。这样一来,任意时刻最多只需缓存长度为sub_seq的logits,显著降低了显存峰值。
MindSpeed MM升级一键安装,Git Clone后单命令即可完成环境部署,支持交互式定制。套件进一步整合训练全栈配置,无需侵入式改码,即可灵活启用 Triton-Ascend算子、Chunk Loss显存优化及FSDP/CP并行等特性,大幅降低Kimi K3等超大模型训练门槛。
部署指导链接:
https://atomgit.com/Ascend/MindSpeed-MM/tree/master/examples/kimi_k3
基于昇腾的Kimi K3推理部署
目前昇腾Atlas 800 A3、Atlas 900 A3 SuperPod以及昇腾950超节点系列产品已经支持Kimi K3基于vLLM Ascend与SGLang开源推理引擎的大EP推理部署,推理性能持续优化中。
Kimi K3接入vLLM Ascend/SGLang后,用户仍可沿用vLLM/SGLang的服务接口、调度方式和参数体系。vLLM Ascend支持Prefix Cache、Chunked Prefill、异步调度、PD分离和内存池化等能力,在适配KDA、Gated MLA和LatentMoE新结构的同时保持这些框架能力与使用方式不变,使K3能够无缝进入现有vLLM推理服务体系。
- 融合算子加速:KDA Prefill与Decode双路径
KDA状态具有严格的时序依赖,vLLM Ascend针对Prefill和Decode为Kimi K3设计了两条执行路径:Prefill以64 Token为Chunk,将Q/K归一化、Gate累积和Chunk KDA组织为批量计算;Decode/MTP则直接在状态池上执行短序列递归更新。
Decode路径使用Ascend C融合Kernel,在单次执行中完成Q/K L2Norm、Gate与Beta处理、状态衰减、Delta Rule、外积更新、输出计算和Final State原地回写。V×K工作状态驻留Unified Buffer,并按“逻辑序列 × Value Head”并行分配任务,从而减少多算子启动、临时Workspace、全局内存往返和阶段间同步开销。
- MoE通算融合:MC2支撑896专家与大规模EP
Kimi K3在部署时,EP64下每张卡只有14个路由专家,而每个Token要访问16个专家,跨Rank交换是必然动作。vLLM Ascend通过MC2将路由后的Token重排、跨Rank分发、局部专家计算和结果回收组织为一条设备侧流水线,避免CPU参与热路径调度。
MC2路径在Dispatch前、GMM2前与Combine前记录Stream Event,使Shared Expert可以在独立Stream中与路由专家、通信阶段重叠。Token分发、专家GMM与结果回收因此可以在设备侧连续推进,减少CPU介入和阶段间等待。
- 原生量化:MXFP4权重与逐Token动态MXFP8激活
Kimi K3以MXFP4承载专家权重、以MXFP8承载专家计算激活。vLLM Ascend通过ModelSlim量化配置直接加载原生量化权重,并在设备侧执行逐Token动态MX量化、生成Per-Token Scale;量化结果与Scale随Token一同进入专家分发和Grouped MatMul,减少权重与激活的存储、访存及中间搬运开销。
量化范围按模块控制:Router保持高精度,发布版权重中的LatentMoE降维、升维投影保持BF16,ModelSlim原生权重则可对其独立量化。第一层专家计算后的激活与MXFP8量化融合,再直接进入第二层矩阵计算,在兼顾关键模块精度的同时减少独立量化Kernel和阶段间同步。
- 并行布局优化:FlashComm1降低冗余计算
vLLM Ascend针对K3多模态输入从全局Embedding切换到TP分片布局的特点,对FlashComm1执行路径进行了模型级适配。vLLM Ascend将布局转换前移到第一层解码器边界,一次完成Token分片和通信编排;后续KDA/MLA仅在确实需要完整序列的位置集中执行All-Gather,避免多次数据收集及其带来的冗余处理。与此同时,vLLM Ascend进一步打通FlashComm1与Shared Expert DP、TP Shard的布局语义,使视觉、注意力和专家计算沿用一致的分片方式,从而减少中间张量搬运和多种并行策略组合下的同步开销。
- SGLang支持DSpark投机推理能力
SGLang在继承原有特性外,与SGL社区同步发布Kimi-K3 DSpark投机推理能力。DSpark算法在一个月前正式公开亮相,通过分层草稿生成,降低自回归推理单次生成开销。本次SGLang在Kimi-K3 Day0支持中创新性引入该算法,解决模型没有原生投机权重的问题,全面提升昇腾上decode阶段的推理性能至TPOT<50ms。
- Kimi K3推理部署指导
用户及开发者可访问以下链接获取Kimi K3基于昇腾的部署指导(实际商业性能与部署方案、参数配置及软硬件环境等因素相关,并将持续优化提升):
vLLM Ascend:
https://docs.vllm.ai/projects/ascend/en/v0.23.0/tutorials/models/Kimi-K3.html
SGLang:
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐



所有评论(0)