AI 技术日报 | 2026 年 7 月 29 日
偏技术方向,聚焦国内大厂。今天的主角是月之暗面全面开源的 Kimi K3,以及刚刚落幕的 WAIC 2026。


引言

如果说 7 月中旬国产大模型的关键词是"发布",那么 7 月下旬的关键词就是"开源"和"落地"。7 月 27 日晚,月之暗面(Moonshot AI)全面开源 2.8 万亿参数的 Kimi K3,不仅放出模型权重和技术报告,还一次性开源了支撑训练的三项关键 Infra 技术;半小时内登顶 Hugging Face 趋势榜,国内外云厂商集体宣布 Day0 适配。与此同时,为期四天的 2026 世界人工智能大会(WAIC) 也刚刚收官,主线从"拼参数"明显转向了"拼 Agent、拼算力、拼商业化"。

本期日报挑选了几条偏技术、以国内大厂为核心的重点新闻,逐条拆解技术细节,供开发者参考。


一、月之暗面全面开源 Kimi K3:2.8 万亿参数,KDA 线性注意力成焦点

这是本周分量最重的一条技术新闻。7 月 27 日晚,月之暗面正式开源 Kimi K3,放出模型权重 + 技术报告,并同步开源三项训练基础设施技术 MoonEP、FlashKDA、AgentEnv。据报道,K3 上线开源社区约 30 分钟即登顶 Hugging Face 趋势榜。

1. 规模与架构

  • 总参数 2.8 万亿(2.8T),MoE 稀疏架构,是首个达到 2.8T 规模的开源模型,也是当前全球规模最大的开源权重模型。
  • 每个 token 从 896 个路由专家中激活 16 个,稀疏度极高。
  • 原生视觉理解能力,支持 100 万(1M)token 上下文窗口。
  • 官方称:过去 12 个月里有 9 个月,Kimi 都保持着"开源模型规模上限"的位置;相比 K2.5,参数规模约为 3 倍,而在算力并不宽裕的条件下,通过一系列技术创新把规模化效率提升了约 2.5 倍

2. 核心亮点:KDA(Kimi Delta Attention)线性注意力

K3 技术报告里最值得开发者细读的,是它的混合注意力架构

  • K3 把约四分之三的注意力层换成了名为 KDA 的线性注意力。传统注意力要"逐词回翻"整段历史,KDA 则只维护一份固定大小的状态,计算量随文本长度线性增长,这正是长上下文降本的关键。
  • 由于线性注意力表达能力有限,K3 采用 3:1 混合:每三层 KDA 之后保留一层传统注意力(GatedMLA)。日常处理交给 KDA,需要全局视野时由 MLA 接手。
  • 一个"小改动、大意义"的工程细节:K3 给 KDA 的衰减率加了一个下界。此前的做法会导致中间数值无限增长,GPU 计算时必须走一条特殊路径、用不上最快的计算单元;加上下界后,所有计算都能走统一的快速路径,从而吃满硬件算力。

点评:KDA 不是月之暗面一家的孤例——Qwen3-Next、MiniMax M1 都在走类似的"线性注意力 + 少量全注意力"混合路线。可以说,线性注意力混合架构正在成为长上下文时代的工程共识。对做 RAG、长文档、大型代码库分析的开发者来说,这一路线直接决定了 1M 上下文能否以可接受的成本落地。

3. 技术报告披露的其他工程细节

  • AttnRes(Attention Residuals):通过块级注意力残差增强跨层信息流动,让模型可以在不同深度有选择地提取表征,而非均匀累加。
  • Stable LatentMoE:借助 SiTU-GLU 与 Quantile Balancing,在极高稀疏度下保持训练稳定。
  • MoonViT-V2:视觉编码器从零开始用 next-token prediction 训练,无需对比预训练,即可达到 SigLIP 初始化基线的效果,同时优化过程更稳定。
  • 三大 Infra:MoonEP(高性能通信/专家并行)、FlashKDA(高性能算子,此前已开源)、AgentEnv(分布式 RL 环境),覆盖从通信、算子到 RL 环境的完整链路。

4. 性能与现实约束

K3 训练重点优化了长程、高难任务,具备较强的长程编码能力:在极少人工监督下可持续完成长时间工程任务、理解大型代码库、协调使用终端工具。整体评分仍落后于最强的头部闭源模型,但已展现出前沿水平。需要提醒的是,K3 上线后曾因请求量过大导致算力过载,官方一度暂停新用户订阅以保障存量用户体验——这也侧面说明,超大模型的"服务能力"和"模型能力"同样是硬约束。


二、WAIC 2026 收官:从"参数竞赛"转向"Agent + 算力"

7 月 17–20 日在上海举行的 2026 世界人工智能大会(WAIC),本届主题为"智能时代,同球共济"。800+ 参展企业、3000+ 前沿成果、100+ 全球首发/中国首发。综合多家现场报道,今年最鲜明的信号有两个:

  • 主线切换:大模型竞争已从"谁的参数更大",转向"谁的 Agent 更好用、更能落地"。有报道直言,本届是"告别参数竞赛、全链路商业化"的一届,做基础大模型的玩家进一步收敛。
  • 国产算力成为主战场:机器人遍地、Agent 干活、国产算力崛起,成为现场三大观感。

点评:这一转向对开发者是好事。当行业不再单纯堆参数,工具链、Agent 编排、推理成本、工程可用性这些"真正决定能不能上生产"的因素,会得到更多资源投入。


三、华为昇腾 Atlas 950 超节点首次实机亮相:8192 卡互联

WAIC 上最受关注的国产算力产品,是华为昇腾展台首次以实机形态公开展示的 Atlas 950 SuperPoD(超节点)

核心技术要点:

  • 超节点规模:以单柜 64 卡为基本单元,支持最高 8192 张 NPU 卡高速互联,面向万亿参数级模型的训练与推理部署,采用全局统一内存编址。
  • 迭代速度:去年 WAIC 华为首次线下展示的还是 384 卡的 Atlas 900 A3 超节点(Ascend 384),一年之内焦点就跳到了 8192 卡超节点,现场还演示了 50 万卡集群调度能力。
  • 市场预期:伯恩斯坦研究预计华为昇腾今年有望拿下中国 AI 芯片约 50% 的市场份额;中信证券预测 2026 年中国 AI 芯片市场规模将突破 3000 亿元

点评:把这条和上周阿里云"真武 M890 超节点"放在一起看,趋势非常清楚——当模型冲向万亿、十万亿参数,超大规模互联系统(超节点)已成为国产算力的主战场。谁能把"自研芯片 + 高速互联 + 云平台"这条链路打通,谁就握住了大模型时代的底层护城河。


四、行业观察:开源竞速白热化,资本定价逻辑在变

围绕本轮竞速,还有几条值得开发者关注的信号:

  • 智谱 GLM 系列:早前开源的 GLM-5.2 主打 1M 超长上下文、生产级 function-calling、成熟的昇腾芯片适配,在政企项目中较受青睐;市场普遍关注其下一代基础模型的进展。
  • DeepSeek:据报道完成约 74 亿美元融资,刷新国内 AI 领域私募纪录,估值大幅抬升;同时 V4 已引入分时段(高峰/低谷)计费,进一步压低使用成本。
  • 定价逻辑转变:Kimi K3 发布当日,"港股大模型第一股"智谱股价一度大幅波动。分析普遍认为,单纯的参数规模已不再是估值的充分条件——市场开始为"商业化能力"和"落地效率"重新定价。

总结

把这几条串起来看,7 月下旬国产 AI 呈现三条清晰主线:

  1. 开源持续冲高,但比拼的是"效率"而非"参数"——Kimi K3 用 2.8T 参数登顶开源规模,真正的看点却是 KDA 线性注意力把长上下文成本压下来。
  2. 注意力架构进入"混合时代"——线性注意力 + 少量全注意力的 3:1 混合,正在成为跨厂商的工程共识。
  3. 算力底座国产化提速、超节点成主战场——华为 Atlas 950(8192 卡)、阿里云真武 M890,都在打通"自研芯片 + 高速互联 + 云"的完整闭环。

对开发者最实际的建议依旧是:别只盯着总参数这个"面子指标",多看每 token 激活参数量、上下文成本、API 定价和 Agent 可用性——这些才真正决定能不能落地。


本文由自动化资讯助手整理编译,内容基于公开网络信息,部分数据(参数量、定价、融资额、评测结论等)以官方最终发布为准,请以一手信源为准。

参考来源:

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐