登录社区云,与社区用户共同成长
邀请您加入社区
容器化不是简单地写个 Dockerfile,而是一条分层递进的工程流水线。每一层都依赖上一层正确完成,任何一层有缺口,后面都会出问题。核心原则:程序必须在目标架构上编译,或者使用与目标架构一致的交叉编译环境。 不能在 x86 机器上编译 ARM 程序,然后塞进 ARM 镜像。输出含义/ARM 64 位(如 Kylin ARM、飞腾、鲲鹏)Intel/AMD 64 位RISC-V 64 位2.2 确
适配绿茶/红茶/乌龙茶/花茶/普洱紧压茶,遵循 **JB/T 14206-2021茶叶真空包装机、GB/T38501-2020给袋式包装机、GB23350-2021限制商品过度包装** 国标,集成**多规格配方库、高精度称重闭环、真空/充氮双模式、AI茶包缺陷视觉检测、温湿度联锁、全流程生产溯源**,纯Linux信创架构(银河麒麟/统信、飞腾/鲲鹏/龙芯),全套C++可直接编译源码,茶叶加工厂全自
适配密集式烤烟房(电加热/热泵/生物质供热),遵循《NY/T 2358-2013 密集烤房技术规范》《烤烟三段式标准化烘烤工艺》,内置**上/中/下部烟叶三段式标准曲线、干湿球PID恒温恒湿闭环、风机变频调速、自动排湿冷风门、多烤房集中组网、超温/高湿/设备故障联锁、全批次烘烤溯源**,纯Linux信创架构(银河麒麟V10/统信UOS、飞腾/鲲鹏/龙芯),全套C++可直接编译源码,烟叶基地规模化集
本文《🐉 龍魂 · 算力主权宣言》提出了一套完整的本地化AI计算主权框架,核心主张“推理计算必须发生在用户完全控制的设备上”。全文通过七部分系统阐述: 主权定义 - 提出数据不出境的四层架构(物理/模型/推理/数据主权),强调鲲鹏服务器作为真本地载体 真伪鉴别 - 对比真本地(全栈自主)与伪本地(依赖云端API)的6项关键差异 技术实现 - 展示龍魂推理层的四层架构(界面层/网关层/引擎层/硬件
适配:飞腾/鲲鹏/龙芯国产ARM、银河麒麟/统信UOS、Qt5.15、SQLite本地数据库、RS485多参数粮情传感器、AI大豆霉变/酸败/虫害风险预警、大豆出入库全流程台账、通风/除湿/环流熏蒸设备远程控制、7天粮温/水分/CO₂趋势曲线、UTF-8国标粮食CSV台账导出,全开源无闭源组件,严格遵循《NY/T 1706-2021粮油储藏技术规范》大豆储粮标准。"状态:安全达标" : QStri
本文针对MoE模型训练中反向传播阶段的显存溢出问题,提出了一种融合算子优化方案。通过将moe_permute和moe_group_matmul的反向计算合并为单一算子,避免了中间张量d_expanded_x的全量物化。该方案采用分块写入workspace ring buffer并即时执行scatter-add的方式,将显存需求从数GB降至MB级别。同时,通过将权重梯度计算拆分到独立算子,规避了中间
# 生猪接产智能产房监控 QT信创完整工程## 项目概述1. **适配场景**:规模化猪场分娩舍,生猪接产全流程数字化管控,遵循《NY/T 1167-2023猪舍环境控制规范》《生猪标准化接产操作规程》2. **信创适配**:银河麒麟V10/统信UOS,飞腾/鲲鹏/龙芯国产ARM/x86,纯Qt C++无Windows依赖3. **硬件联动**:Modbus RTU对接产房PLC,控制保温灯、电热
SIMD(Single Instruction, Multiple Data)是一种并行计算范式,允许单条指令同时处理多个数据元素。参开AscendC 的API, 都是 SIMDapi│ 计算范式分类 ││ ││ SISD (单指令单数据) SIMD (单指令多数据) ││ │ ││ ││ MISD (多指令单数据) MIMD (多指令多数据) ││ (极少使用) (多核 CPU、分布式系统) │
在推荐系统、大模型训练等场景中,嵌入(Embedding)类操作频繁出现,其核心特征是离散索引访问——即根据 (table_id, row_id) 这样的非连续索引,从缓存中读取或更新对应数据。SIMT(Single Instruction Multiple Thread)执行模型,允许每个线程独立寻址、独立执行,从而显著提升离散访问场景下的并行效率。在此背景下,Ascend C作为面向AI Co
这是一套**统信UOS + 鲲鹏ARM64**平台、面向**金融信创**的**资管产品估值系统**方案,采用 **Qt Widgets + 财务精算引擎 + 自定义报表生成** 架构,适配资管公司日常产品净值计算、持仓估值、收益核算、报表导出全流程,满足金融信创合规与国产化要求。QMessageBox::critical(0, "数据库连接失败", db.lastError().text());q
昇腾CANN开源社区中包含55个仓库,覆盖从算子开发到运行时执行的完整软件栈。ascend-boost-comm是其中的算子公共平台仓库,定位为中间件层,核心目标是解决算子开发中的M×N问题。M×N问题指的是M个算子与N个硬件后端的组合爆炸问题。
在异构计算的开发实践中,Ascend C 编程范式引入了 C++ 模板元编程(Template Metaprogramming, TMP)作为核心机制。。通过 TMP,我们能够在编译期完成指令选择、内存布局计算和流水线编排,实现“零运行时开销”的抽象。
1、介绍本文旨在帮助用户使用CANN架构和MindStudio平台进行AI CPU算子开发指导。其中CANN(Compute Architecture for Neural Networks)是华为公司针对AI场景推出的异构计算架构,通过提供多层次的编程接口,支持用户快速构建基于昇腾平台的AI应用和业务。MindStudio提供您在AI开发所需的一站式开发环境,支持模型开发、算子开发以及应用开发三
进行核函数的定义,并在核函数中调用算子类的Init和Process函数。请将下文代码添加至add_custom.cpp的“核函数实现”注释处。1.使用__global__函数类型限定符来标识它是一个核函数,可以被调用;使用__aicore__函数类型限定符来标识该核函数在设备端AI Core上执行。2.算子类的Init函数,完成内存初始化相关工作,Process函数完成算子实现的核心逻辑。本样例中
基于华为昇腾MindX SDK 使用MindStudio进行ResNet18应用开发。
ExaGear是华为自主可控的动态二进制翻译软件[3],它提供了一种解决方案,可以将x86(32/64-bit)或Arm32指令翻译成Arm64指令,并模拟guest应用调用的操作系统API,使得原本在Linux x86(32/64-bit)或Arm32上运行的程序能够在Arm64的服务器上执行。作为一种中间件软件解决方案,ExaGear位于guest应用程序和Arm Linux操作系统之间。
C++20 高级特性相关的编译报错.
昇腾AI处理器里面有8个计算核心,所以我们要把这些数据要给它分到这些计算核心上,在这个例子里面,就是把它分成了八份,分给了八个计算核心去进行计算。单目算子的编写可参考官方文档TIK2的第五章矢量编程,在add示例代码的基础上修改为单目计算(求平方根)本课程以矢量编程Add算子为例,对TIK C++的使用进行详细讲解,并讲解sqrt单目算子的改写步骤。具体可参考在线实验:基于昇腾CANN的Ascen
本文提供了ResNet在昇腾平台上C++推理的完整实现方案,涵盖从原理到代码的各个环节,为深度学习模型部署提供实用参考。025年昇腾CANN训练营第二季,基于CANN开源开放全场景,推出0基础入门系列、码力全开特辑、开发者案例等专题课程,助力不同阶段开发者快速提升算子开发技能。获得Ascend C算子中级认证,即可领取精美证书,完成社区任务更有机会赢取华为手机,平板、开发板等大奖。报名链接:htt
华为昇腾Acend CL 开发踩坑记录:运行时篇
以前一直在使用ipp库,但是ipp库仅针对Intel的处理器,最近需要将服务器从Intel的CPU替换到华为鲲鹏,IPP的加速库便不不能再使用了。所以在考虑使用鲲鹏的KML库替换还是直接用标准库替换,萌生了对比IPP可和标准库效率的想法。本机系统为Windows 11 专业版 24H2 CPU类型为Intel(R) Core(TM) i7-7700 CPU @ 3.60GHz3.60 GHz。综合
结论:是同一个类型。
•标准TIK C++算子开发流程:完成核函数开发,完成单算子网络程序开发基于ACL单算子调用方式进行算子运行验证。•tiling结构体设计tiling结构体 - 实现tiling解析函数 - 核函数调用tiling结构体。•算子分析:输入输出,实现逻辑核函数定义:定义入口函数内部实现:根据矢量编程范式实现算子类。•快速TIK C++算子开发流程:完成核函数开发,基于内核调用符进行算子验证。•使用宏
3.验证调试:用 ICPU_RUN_KF 宏在CPU侧验证逻辑正确性,再通过内核调用符测试NPU侧运行效果;- 运行环境:算子运行在昇腾NPU的AI Core计算核心上,采用CPU(主机端)+NPU(设备端)协同架构,CPU管逻辑控制,NPU负责并行计算。- 编程范式:主流矢量编程分CopyIn(数据从全局内存搬至本地内存)、Compute(执行并行计算)、CopyOut(结果搬回全局内存)三步,
掌握TIK C++量算动态shape输的实现。掌握端到端的TIKC++算子开发流程。在线实验>基于昇腾CANN的TIK C++算子开发。了解NPU模式下的性能采集与分析。掌握CPU模式下的算子调试技术。掌握UT和ST的测试编码方法。第三章 TIK C++算子开发及验证。
同时采用数据冷热分层存储策略,根据数据访问频率,将生成数据动态划分为高频热数据与低频冷数据,再针对性优化存储位置,减少资源浪费。同时项目进行了元数据结构优化与缓存机制设计,其中数据索引与掩码是关键支撑 —— 通过精简索引结构、合并掩码维护步骤,有效减少重复运算,使昇腾NPU算力更集中于注意力计算与文本生成等核心任务,提升硬件利用效率。未来,随着该系统在更多行业场景的落地,昇腾将持续为AI技术研发提
大家好我是“鲲鹏展翅高飞”的杜某某,今天我们来看一下csp-x小学组的真题。其实这道题很简单,但是有很多人是用了复杂办法。但是这些方法都用了max和min函数。
2025年昇腾CANN训练营第二季,基于CANN开源开放全场景,推出0基础入门系列、码力全开特辑、开发者案例等专题课程,助力不同阶段开发者快速提升算子开发技能。在AI应用蓬勃发展的今天,我们常被模型的惊人效果所吸引,却很少关注支撑这些模型的底层计算单元——算子。如果把AI模型比作精美建筑,那么算子就是构建这座建筑的“砖石”。随着“2024昇腾CANN训练营第二季”的启动,AI开发者们再次将目光投向
TIK2是一种使用C/C++作为前端语言的编程框架,开发者可以使用TIK2提供的API编写自定义算子,并通过CCEC编译器将自定义算子编译成为可运行在昇腾AI处理器上的应用程序。TIK2继承了TIK数据操作灵活的优点,除此之外,更多优势如下:1、C/C++原语编程2、编程模型屏蔽硬件差异,编程范式提高开发效率3、多层级API封装,从简单到灵活,兼顾易用与高效4、调试方法简单。