登录社区云,与社区用户共同成长
邀请您加入社区
昇思 Web 与 API 推理云托管模型服务,是深度学习模型从实验室走向生产环境的核心环节,也是鲲鹏国产化算力平台实现 AI 业务规模化的关键支撑。依托 FastAPI 轻量化框架与昇思全场景推理能力,开发者可快速将 AI 模型封装为标准化云服务,实现跨平台、跨系统、跨设备的远程调用。服务原生适配鲲鹏 ARMv8 架构,无需指令集迁移、无需依赖改造,具备高性能、低延迟、高稳定、易部署等优势。
:昇腾实战派。
随着小模型在特定任务上展现出接近甚至超越大模型的推理能力,“专而精”的小模型在资源受限场景下优势明显。与此同时,华为Ascend系列算力卡进入市场后,用户对算力资源隔离与整体利用率提升的需求日益迫切。通过资源虚拟化技术,将物理NPU切分为多个vNPU挂载到容器中,可实现统一资源分配与回收,满足多用户频繁申请/释放资源的操作需求。本文以静态虚拟化方式,在昇腾推理服务器裸机上提供小模型RECCE的切分
网络流量分析是网络安全与运维的关键技术,但传统方法依赖大量人工标注数据,泛化能力差。自监督预训练模型的出现为解决标注数据稀缺问题提供了新思路。本文基于昇腾 AI 平台,介绍 TrafficFormer 的模型架构、环境部署与预训练实践。
昇腾NPU量化实战——从FP32到INT8的完整指南
本文介绍了使用昇腾官方开发套件asc-devkit快速开发NPU算子的完整流程。通过创建Softmax算子实例,展示了从工程初始化、代码生成、编译测试到部署的全过程。asc-devkit封装了算子开发的各个环节,提供一站式解决方案,包括创建工程模板(asc create)、自动生成框架代码(asc generate)、编译(asc build)、测试(asc test)和部署(asc instal
摘要:本文介绍了CANN图编译引擎GE中的关键优化Pass,可显著提升模型推理性能。重点分析了常量折叠(ConstantFoldingPass)和算子融合(OpFusionPass)两个核心优化技术:常量折叠可将编译期可计算的子图预先计算,减少推理时计算量;算子融合则将多个小算子合并为大算子,降低Kernel Launch开销。实验数据显示,在YOLOv5模型上应用常量折叠可获得18.7%的加速效
你有没有想过一个问题:PyTorch已经有了一套完整的张量操作(torch.cat等),昇腾CANN为啥还要自己搞一套ops-tensor?是重复造轮子,还是真的有必要?第一次接触ops-tensor的时候,也被这个问题困扰过。明明PyTorch的张量操作已经很好用了,为啥还要学一套新的?是昇腾NPU的硬件有特殊要求,还是CANN的架构设计使然?带着这个疑问,翻了一遍ops-tensor的源码,跑
Meta开源的torchtitan-npu是昇腾NPU适配版本,基于PyTorch FSDP框架实现大模型训练。它通过替换设备抽象层、通信后端和算子适配(CUDA→CANN),支持在昇腾NPU上运行LLaMA等模型。环境需严格匹配CANN 8.0+、PyTorch 2.1.0+等组件版本,配置文件支持7B/13B/70B等不同规模的模型训练。框架提供FSDP+HCCL数据并行方案,支持Tensor