登录社区云,与社区用户共同成长
邀请您加入社区
本文记录在 Atlas 800I A2(8×Ascend 910B3)上部署 MiniMax-H3 的完整过程,涵盖 Docker 数据目录迁移、MindIE-SD/RainFusion 配置、packed-varlen 注意力 OOM 修复、异步视频任务接口及并发排队排查,并给出 15 秒 768P 视频与音频的实测结果。
Gather 算子是深度学习推理中常用的数据重排操作,用于从输入张量中按指定索引收集数据。在 MoE(混合专家)路由、Embedding 查找等场景中,Gather 的性能直接影响端到端推理延迟。本文从基础实现出发,逐步优化至支持多维输入和 batch_dims 的通用版本,并分享在 Atlas 800I A3 上的性能调优经验,帮助开发者掌握 Ascend C 算子开发与优化的核心方法。
原来,我们为了加快测评速度,将并发数设置得过高,导致vLLM Ascend的调度器频繁进行请求抢占,而被抢占的请求无法复用之前的缓存,必须从头开始重计算。大模型的精度和性能优化是一个长期的过程,而高效的性能监测是这个过程中不可或缺的工具。我们需要的是一种“无感接入、在线监测、动态扩展”的指标采集方案,能够在不影响长时任务运行的前提下,透视vLLM Ascend内部的每一个细节。**无需重启正在运行
本项目实现了一个DualMaxPooling(双最大值池化)算子,并且通过高维切分、数据搬移优化、double-buffer等优化手段进行了性能优化。