CANN 开发者 Meetup · 杭州模型专场圆满收官:7 场硬核分享,把大模型推理讲到透
8 月 8 日下午,由 CANN 开源社区联合 AtomGit 落地的 CANN 开发者 Meetup · 杭州模型专场在杭州云谷福地中心落下帷幕。 7 场硬核分享一路持续到傍晚 18:00,现场坐满了来自杭州及周边地区的 AI 工程师及爱好者。

当大模型落地进入性能攻坚阶段,昇腾 NPU 推理、KV 缓存调度、MoE 异构部署、视频生成模型适配、自定义算子优化,成了开发者绕不开的核心难题。本次 Meetup 正是为了打通模型从论文到昇腾硬件落地的全链路而设——不讲空泛理论,全是基于昇腾 910/950 系列硬件、CANN 最新架构落地实践的可复用调优方案。
GLM-5.2 KV Cache Offload 系统优化实践

首先,CANN 大模型推理优化技术专家 孔昊登台分享了基于 **GLM-5.2 DSA 稀疏注意力结构的 KV Cache Offload 方案。**他详细拆解了 Prefill 阶段将 KV Cache 完整下沉 Host 侧、Decode 阶段按需取回被选中 KV 的核心思路,并利用相邻步 Top-K 高达 58.85% 的重叠率在 Device 侧构建热点池,配合 vLLM 的 PD 分离适配。实测在 Atlas A3 双节点 16 卡上,吞吐从基线提升至 3,755 token/s,净增约 55%,为长上下文高并发推理提供了一条直接可用的优化路径。
Agent 赋能模型部署优化:Hy3 昇腾推理实践

紧接着,CANNBot Committer 王子恒带来 腾讯混元 Hy3 的昇腾推理实践。他分享了如何把 CANN 模型优化经验沉淀为可执行、可验证、可复用的 Agent 工作流,并完整演示了 295B 参数 Hy3 大模型在昇腾 950 PR/DT 平台上的部署与优化全过程。整个优化链路中约 80% 的方案设计与代码开发可由 Agent 自动完成,开发者只需要审核关键决策,通过并行切分、融合算子改造、MXFP 量化、图模式与 MTP 投机推理等一系列手段,Decode 单步时延从基线 103.18 ms 一路压到 17.98 ms,实现 5.74 倍加速,上述 Agent 部署优化流程耗时仅 10.8 小时。
PyPTO 编程框架与 Agent 算子生成能力

CANN 算子专家 潘柏屹介绍了基于 Python 的算子编程框架 PyPTO——用 Tensor 描述“做什么”、用 Tile 保留“如何高效执行”的优化空间,并展示了基于 Plugin Agents + Skills 的三阶段算子生成工作流。以百灵 Ling-3.0-Flash 大模型的核心 KDA 算子为实战案例,这套流程把需求对齐、算子编码到整网接入的全过程压缩到一周内完成,让“写算子”这件事第一次有了可复用的工业化路径。
DSV4-Flash 昇腾 950DT 推理:DSpark 推理实现与性能优化

CANN 大模型推理专家 王正平带来了置信度调度的投机解码 DSpark 在 950DT 上的实现分享——先并行完成主要计算,再用轻量顺序模块补回 token 间依赖,包含并行预测、顺序修正、置信度筛选、批量验证四个核心步骤。通过独立块级投机模块、融合算子与多流并行等实现,首 token 接受率达 89%,等效 TPOT 从 MTP1 方案的约 9.83 ms 降至约 3.93 ms,Token 生成效率提升约 2.5 倍。
Longcat 2.0 推理低时延优化

CANN 推理技术专家 葛根华分享 Longcat 2.0 超长序列模型的推理低时延优化。作为参数规模约 1.6T 的 ShortCut-MoE 模型。他介绍了 Prefill 阶段的 PP+CP 切分与 Decode 阶段的 DP128+EP128 部署策略,以及权重预取、SuperKernel 算子二进制融合等优化手段,最终在 Atlas A2 集群上实现 TPOT 时延 20 ms,并支撑单条 1M 超长序列推理,为超长上下文场景提供了可参考的工程范式。
SanaVideo 模型 NPU 单卡部署与性能优化实践

CANN 大模型推理优化专家 李祎杰带来 SanaVideo 文生视频模型 NPU 单卡部署实践,分享了从 Prompt 到 MP4 全流程在单卡完成的端到端方案:Gemma 文本条件编码、DiT 扩散采样、WanVAE 视频解码全部跑在一张 NPU 上。通过 npu_rms_norm 等融合算子替换与 A4W4_MXFP4 混合精度量化,VBench 精度几乎无损,并现场演示了基于 CANNLab 一站式平台的一键复现闭环。
DSV4-Flash 昇腾 910 单卡部署样例方案及实践分享

面对 300B 权重、单卡只有 64GB GM 的硬约束,处理器算法专家 袁源分享了 Ascend NPU + Kunpeng CPU 异构架构下的 A/B 混合 offload 设计:热专家常驻 NPU 复用、冷专家在 CPU 就地计算,配合动态热专家常驻与流式 prefill 等优化,最终在 910 单卡上跑出 Decode 19–22.5 tok/s 的实测成绩。而这一方案正是本次活动的真机实操环节——现场开发者携带个人电脑,亲手把 DeepSeek-V4-Flash 部署到了昇腾 910 硬件上。
问答与交流:从台上问到台下
现场除了讲师们的干货分享,还有贯穿全场的问答与交流。无论是每一场演讲结束后的问答环节,还是茶歇时间与最后的自由交流时段,现场的交流都格外踊跃:有人关心 Agent 优化工作流在全新架构模型上能否稳定复现,有人追问 KDA 算子的矩阵求逆如何在 Cube 上高效实现、PyPTO 底层是否生成 Ascend C 代码,也有人围绕 DSpark 多流并行是否带来 Cube 抢占、Longcat 2.0 是否做了 KV Cache offload 等工程细节与讲师深入探讨。听众的问题一个接一个,讲师们也都毫无保留地现场拆解。

从开发踩坑到性能瓶颈,再到自定义算子难题,大家互相讨论,交流思想。这正是线下 Meetup 的意义——台上讲方法,台下聊落地,让每一次提问都有回响。
真机实操:两个模型,一张卡,亲手跑通
如果说前面的分享是“听方法”,实操环节就是“练真功”。从第六讲开始,现场真机实操正式启动,带电脑到场的开发者们人手一台设备,跟着讲师节奏同步操作;到第七讲结束,两轮实操任务全部就位,现场留出 30 分钟左右的完整实操时间,讲师与专家团队全程驻场提供技术支持。




第一轮是 SanaVideo 文生视频模型部署。 基于 CANNLab 一站式平台,开发者只需下载 Conda、创建环境,然后一键执行 infer_platform.sh——脚本会自动完成 Torch 与 Torch NPU 安装、Sana 源码拉取、NPU patch 打入、权重下载与推理执行的全流程,把“从 Prompt 到 MP4”在 NPU 单卡上完整跑通。
第二轮是 DeepSeek-V4-Flash 昇腾 910 单卡部署。开发者克隆 cann-recipes-infer 仓,按样例文档配置环境,借助 NPU 与鲲鹏 CPU 的异构 offload 方案,把 300B 参数的大模型在 64G 单卡上运行起来。
“实践才是真知”,实操期间,不少开发者在讲师的帮助下,现场调试,当场解决自己的部署问题。
大模型推理正在从“能跑”走向“跑得好”,Agent、算子框架、异构 offload 这些新工具,也正在把优化从个人经验变成可复用的工程能力。
感谢 7 位讲师毫无保留的分享,也感谢每一位到场交流的开发者,把杭州的午后过成了硬核技术场。
后续 CANN 开源社区与 AtomGit 还会带来更多线下技术沙龙与模型专场,欢迎持续关注。下次 Meetup,我们不见不散。
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐



所有评论(0)