登录社区云,与社区用户共同成长
邀请您加入社区
模型减负,高效部署!
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐
RTX 5090 涨价交期排到年底,企业 AI 部署还有第三条路
DeepSeek 私有化部署硬件选型实战:从 32B 蒸馏版到 671B 满血版双路线评估
【AscendC】MoeInitRoutingGroupedMatmulGrad 算子设计
本文针对MoE模型训练中反向传播阶段的显存溢出问题,提出了一种融合算子优化方案。通过将moe_permute和moe_group_matmul的反向计算合并为单一算子,避免了中间张量d_expanded_x的全量物化。该方案采用分块写入workspace ring buffer并即时执行scatter-add的方式,将显存需求从数GB降至MB级别。同时,通过将权重梯度计算拆分到独立算子,规避了中间
扫一扫分享内容
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
所有评论(0)