登录社区云,与社区用户共同成长
邀请您加入社区
昇思 Web 与 API 推理云托管模型服务,是深度学习模型从实验室走向生产环境的核心环节,也是鲲鹏国产化算力平台实现 AI 业务规模化的关键支撑。依托 FastAPI 轻量化框架与昇思全场景推理能力,开发者可快速将 AI 模型封装为标准化云服务,实现跨平台、跨系统、跨设备的远程调用。服务原生适配鲲鹏 ARMv8 架构,无需指令集迁移、无需依赖改造,具备高性能、低延迟、高稳定、易部署等优势。
适配的第一步是让 oneDNN 的构建系统能够识别并链接 kuDNN。## 2.1. 引入KuDNN在 oneDNN-3.4/cmake/KuDNN.cmake 中,通过 find_package 寻找 KuDNN 及其依赖(如 KBLAS)。if(kdnn_cmake_included) return() endif() set(kdnn_cmake_included true) include
Gather 算子是深度学习推理中常用的数据重排操作,用于从输入张量中按指定索引收集数据。在 MoE(混合专家)路由、Embedding 查找等场景中,Gather 的性能直接影响端到端推理延迟。本文从基础实现出发,逐步优化至支持多维输入和 batch_dims 的通用版本,并分享在 Atlas 800I A3 上的性能调优经验,帮助开发者掌握 Ascend C 算子开发与优化的核心方法。
HPC鲲鹏高性能计算解决方案介绍和使用 本期和您一起学习鲲鹏HPC架构和优势,掌握鲲鹏HPC资源获取和使用方法。
鲲鹏统一并行加速库(KUPL)是基于鲲鹏处理器深度优化的并行加速库,包括多线程编程,数据管理,矩阵编程三类基础与扩展功能,结合鲲鹏处理器硬件特性,提供优化的调度与同步算法、异步数据搬运等差异化能力,从高性能,高易用角度为鲲鹏平台应用加速提供助力。详情链接: https://www.hikunpeng.com/developer/hpc/kupl当前KUPL所有接口由C/C++、汇编语言实现,但在高
【代码】php信创性能优化与兼容性治理体系 国产CPU架构(鲲鹏、飞腾、龙芯)PHP编译与优化体系 项目验收标准与测试 中间件适配与落地体系。
本文基于 Atlas 800T A2,围绕 Qwen3-30B-A3B MoE 模型在异步 RL 训练场景下的全链路调优,覆盖 vLLM-Ascend 推理侧 EP/TP 切分、MoE 算子与 HCCL AIV 通信优化,以及 FSDP 训练侧 GMM 融合、Ulysses 负载均衡与 Megatron 对比选型;并完成 Fully-Async 架构在昇腾 NPU 上的适配,通过 stalenes
摘要: 昇腾NPU通过PTO(Portable Tile Operator)虚拟指令集实现跨硬件算子兼容,解决AI编译器直接生成硬件机器码的维护难题。PTO定义90+标准Tile操作,由Graph Compiler将计算图转换为PTO指令,经融合、Tile切分和调度优化后,映射为NPU机器码。调度策略(如流水线和指令重排)显著影响性能,如Transformer模型吞吐可差3倍。开发中需注意同步屏障
本文介绍了昇腾CANN架构中的Graph Engine(GE)组件,它位于计算执行层,负责将优化后的计算图高效调度到NPU硬件执行。GE通过图切分、多流并发和内存管理三大功能提升性能,支持算子融合和显存复用。文章提供了PyTorch调用NPU的示例代码,并详细解析了GE的核心概念(图、流、算子)和工作原理。通过设置日志级别可查看GE的调度过程,对比优化前后的计算图。最后解答了GE与ATC编译器的区