Day 3 支持: MeshFusion 完成全量 Kimi K3 昇腾适配,提供 KDA 注意力卸载
近日,月之暗面重磅开源 Kimi K3:2.8 万亿参数、全球首个开源 3T 级大模型,原生支持 100 万 token 超长上下文,以混合线性注意力(KDA)结合注意力残差技术(AttnRes) 的混合注意力架构,在多项权威评测中取得开源模型最佳成绩。
模型发布当周,XSKY MeshFusion(星飞 AI 推理加速系统)即完成 Kimi K3 的 KV Cache Offloading 在昇腾 910C 上的适配与验证。在英伟达 GPU 与华为昇腾 NPU 两大算力平台上同步就绪,助力客户在国产算力平台上也能第一时间体验扩展 KV Cache 带来的推理加速度。
两种注意力、两套 KV:最难缓存的一代模型
Kimi K3 在同一模型内混合了两类注意力层:KDA 是线性注意力家族的新成员,维护固定大小的序列状态;Gated MLA 保留按 token 累积的分页 KV。两类层的状态组织、复用边界与搬运粒度均不相同,是当前 KV 状态结构中复杂度最高的一类。月之暗面在官方博客中也明确指出,KDA 给传统 Prefix Caching 带来了新的挑战。
挑战的另一面是收益。K3 官方 API 定价中,缓存命中与未命中的输入价格相差 10 倍,官方服务在编码负载下的缓存命中率超过 90%——KV Cache 复用率就是这款模型推理成本的第一变量。而新一代架构恰恰更利于卸载:KDA 的线性状态与 MLA 的压缩表示,让每 token 的搬运量显著小于传统模型。我们分析发现,主流推理引擎登记的 350 余个模型架构,其 KV 状态只归结为 12 个语义类别,这也是 K3 的适配能在发布当周完成的原因。
4 台 910C、2.8 万亿参数:全量 K3 适配验证

我们在 4 台昇腾 910C 组成的集群上部署了 2.8 万亿参数、896 专家的全量 Kimi K3,接入完成适配的 MeshFusion,实现 K3 混合注意力 KV Cache 在华为 CANN 生态下的正确卸载与取回。

基于 4 台昇腾 910C 部署的 896 专家全量 Kimi K3 模型,集成 MeshFusion 推理加速系统
此前,MeshFusion 已在昇腾平台率先完成混合注意力模型 KV Cache Offloading 的生产级落地,此次 K3 适配是这一能力在最新模型上的延伸。在原有 CUDA 生态适配的基础上,MeshFusion 进一步加强了 KV Cache 扩展加速能力在昇腾 NPU 上的兼容性。助力客户在主流国产算力平台上也能第一时间体验 KV Cache 扩展带来的推理加速能力。
让最新的模型,跑在更快的速度上
XSKY MeshFusion 利用多台推理服务器上的 DRAM 与 NVMe SSD 组织成全局共享的 KV Cache 存储池,把推理上下文记忆从 TB 扩展至 PB 级别。权威第三方实验室测试表明,MeshFusion 在长上下文推理场景中可带来最高至 57 倍的吞吐(TPS)提升与最高至 98% 的首 Token 延迟(TTFT)下降——如今,这套能力已对 Kimi K3 在 GPU 与昇腾双栈同步开放。
若您希望在昇腾 NPU 和 英伟达 GPU 上同样加速 Kimi K3 的推理效率、提升资源利用率与 Token 生产力,欢迎致电 400-016-6101,咨询 XSKY MeshFusion 华为昇腾 KV Cache 加速方案。
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐



所有评论(0)