登录社区云,与社区用户共同成长
邀请您加入社区
本文档将介绍基于vLLM-Ascend的GLM-5.1模型在Atlas 800I A3上的单机混部部署实践,包括支持的特性、特性配置、环境信息以及性能测试典型case。
本文档将介绍基于vLLM-Ascend的MiniMax-M2.5模型在Atlas 800I A3上的单机混部部署实践,包括支持的特性、特性配置、环境信息以及性能测试典型case。
本文档将介绍基于vLLM-Ascend的DeepSeek-V3.2模型在Atlas 800I A3上的单机混部部署实践,包括支持的特性、特性配置、环境信息以及性能测试典型case。
昇腾大模型推理“一键跑通”指南——cann-recipes-infer实战与优化全解析
摘要:本文基于昇腾CANN ops-transformer工具链,详细解析了RMSNorm算子在昇腾NPU上的实现方案。相比传统LayerNorm,RMSNorm通过去均值化设计降低12%显存占用,提升8%计算效率。文章从三层架构(算子接口、Ascend C内核、梯度反向)拆解实现细节,重点探讨FP16/BF16下的数值精度挑战,提出Kahan补偿等优化策略,最终在昇腾NPU上完成端到端验证,为L
昇腾NPU MoE路由算子优化解析 本文深入剖析昇腾CANN生态中ops-transformer的MoE路由算子实现与优化策略。MoE架构通过Top-K选择将Token动态分发至专家子网络,其核心瓶颈在于跨节点的AlltoAll通信开销(可占推理流程30%以上)和负载不均衡问题(算力利用率可能低于30%)。ops-transformer采用Ascend C语言实现RouteFn(路由决策)和Rou
本文解析了华为CANN架构中ops-transformer的设计原理,重点拆解了FlashAttention的实现路径。ops-transformer并非单一算子库,而是包含接口层、调度优化层和算子实现层的三层架构。FlashAttention的执行流程分为五个阶段:Python接口转换、调度优化(Tiling和多核分配)、AscendC算子实现、可选融合决策以及Runtime下发。其性能优势源于
这篇文章深入解析了FlashAttention在昇腾NPU上的实现原理,指出常见的三大误区:1) 误将其视为单一算子而非融合策略;2) 忽视tiling参数对片上缓存利用的关键影响;3) 不了解在线Softmax和因果mask的优化机制。核心在于通过tiling分块、在线计算和跳过无效计算,确保中间结果始终驻留片上缓存,避免HBM访问瓶颈。文章特别强调默认配置已优化,但遇到性能问题需理解底层原理才
本文探讨了语言模型训练中交叉熵损失计算的优化方法。传统做法需要三次kernel调用(softmax、log、NLL)和两次中间矩阵存储,导致大量HBM写入(LLaMA-7B下每次计算约262MB)。作者提出融合方案,通过数学等价变换将log(softmax(x))简化为x-logsumexp(x),实现单kernel计算。该方案在300B token训练中可节省38PB的HBM写入量,对大规模训练
摘要:LLM推理面临的主要瓶颈是显存而非计算,特别是长上下文下KV Cache的二次增长导致显存不足。ATB采用PagedAttention和虚拟内存管理技术,将KV Cache分页存储,按需申请页面,有效解决显存碎片问题。标准KV Cache需要连续分配大块显存,而PagedAttention将显存划分为16KB页面,允许非连续分配,显著提高显存利用率。ATB实现包括全局页池管理、逻辑到物理地址
ATB就像是"Transformer的高速流水线"——你把输入(hidden states、attention mask、KV cache等)扔进去,它自动帮你做Attention优化、FFN优化、KV Cache优化,最后输出logits,全程流水线执行,延迟低、吞吐高。我第一次接触ATB的时候,也被它的"自动优化"搞得很懵。明明Transformer的结构是固定的(Attention → FF