登录社区云,与社区用户共同成长
邀请您加入社区
鲲鹏平台的BRBE是一项硬件级别的分支记录技术,旨在提供低开销、高效率的代码执行路径捕获能力。它类似于x86架构中的LBR(Last Branch Record),为开发者提供了强大的性能分析与优化能力,它们的基本原则是相同的:硬件记录每个分支的from、to地址以及一些额外数据(例如时延)。具体来说,func1() → func2() → func3()显然是占用时钟周期最长的调用路线,其主要耗
鲲鹏DevKit AI采用轻量化、标准化的MCP形态部署,支持快速部署、开箱即用,兼容多种开发环境,可无缝集成至主流智能编程助手(如Cline、Trae等),实现DevKit常用工具的自动化调用,该工具也会继续协同Agentic AI技术快速演进,提供更多开发辅助能力,提升鲲鹏亲和应用开发效率。提供了鲲鹏版本编译器,编译运行更快的二进制文件;鲲鹏DevKit开发套件就是亲和鲲鹏架构的开发工具套件,
除了Mamba3-block适配与MIMO创新突破,我们依托Agent-Skills的高效适配能力,实现了Triton算子的快速适配,进一步完善框架的算子生态,提升模型运行的兼容性与高效性。Agent-Skills凭借其灵活的算子封装与快速集成特性,无需复杂的手动开发与调试,即可快速完成Triton算子与MindSpeed LLM框架的无缝对接,有效降低算子适配门槛,缩短适配周期,为框架的功能拓展
该功能深度集成“自动权重转换”与“在线数据处理”技术,单脚本即可启动全流程训练,彻底打破预处理、转换、训练之间的技术壁垒,显著提升大模型训练效率。新功能只需单脚本就能串联起“权重转换-数据预处理-模型训练”全流程,并针对不同训练场景提供了多样化的参数配置方案:无论是从 HuggingFace 加载权重直接训练、开启双向权重转换、仅转换最终模型权重,还是自定义数据处理规则,通过参数配置即可实现,兼顾
随着AI for Science的兴起,深度学习与数据驱动的方法被引入到传统高性能计算流程中,计算负载由领域数值算法转向AI算子为中心,计算图驱动,并与传统高性能计算进行动态交互的混合计算模式,针对传统硬件架构的调优方法越来越难获得有效收益。通过构建这种深度耦合、高效易用的技术体系,鲲鹏软硬协同不仅为全球科研机构提供了高性能且自主创新的算力支撑,更在行业转型中发挥了关键作用,促使高性能计算的开发范
随着云计算与AI算力规模快速增长,数据中心能耗已成为运营核心痛点。设备高功耗不仅持续推高用电成本,加剧散热负担,更带来显著碳排放压力,与算力行业碳中和改造趋势相悖。在算力需求持续增长与行业能效标准日趋严格的背景下,服务器能效优化已从单纯的“成本考量”,转变为“战略升级刚需”。在保障业务性能稳定的前提下,通过精细化调控手段降低能耗、提升算力资源利用率,是当前数据中心实现降本增效、低碳运营的重要方向。
MindCluster通过各组件间的配合,实现了通用超节点调度算法,保证任务带宽的同时还能有效减少资源碎片,是企业在进行昇腾集群调度中不可或缺的重要工具。除此之外,MindCluster还提供了超大规模集群调度、故障快恢、亚健康设备无感切换、指标监测等诸多能力,助力企业更快、更稳的使用昇腾设备。欢迎你访问MindCluster的开源仓主页,提出你宝贵的issue,共同参与到社区的开发和成长。
如下图4所示,可以看到async_task_queue连线(用于关联Python至CANN的任务下发关系)坡度非常大,这说明Python层的下发队列中有任务,但是一直没有下发,造成大约3.2ms的空泡。图6可以看得更清楚。某Linux服务器,已经发现了性能膨胀和Host侧空泡问题,但是仅仅从Profiling数据,无法判断真实原因,缺少对于Host侧的性能分析手段。以卡3为例,其Host To D
鲲鹏沙箱以快照快启、共享Rootfs、超节点共享内存三大核心技术破局——将沙箱启动从分钟级压缩至毫秒级,通过写时复制(CoW)实现多实例镜像层零冗余共享,依托鲲鹏超节点架构进一步释放内存潜力,为Agent高弹性、高并发、高安全的云原生运行环境提供全新底座。Agent沙箱既要解决安全隔离带来的性能损耗,也要处理好高并发产生的资源争抢,鲲鹏将持续深耕Agent原生基础设施,推动沙箱标准的开放与生态的统
线性层将传统的非线性Attention演变成了Linear Attention,打破了长序列下O(n²)的复杂度,其采取的Linear Attention算法是业界最领先的Gated Delta Net(GDN),它融合了Mamba与Delta Net算法,可以兼顾全局衰减的同时,建立单键值替换的逻辑。FFN层采用经典的MOE结构,专家数多达512,专家小,中间层hiddensize仅1024,每