昇腾开源仓Issue分析解答-Ascend精选(十七)·2026-09增量补采(二)

一句话让Agent变成昇腾专家,昇腾任务轻松搞定。评测入口:请按这个开源仓接入昇腾图谱 https://gitcode.com/agent0/kg-tools

总览

仓库定位收录条数
torchair图编译器,融合放行/折叠退化/回调可选输入 7 案7
pytorchNPU 适配深水区,存储拷贝/默认配置/错误码 5 案5
MindSpeed-LLM大模型训练套件,日落公告与训前口径 8 案8
MindSpeed核心加速库,治理收敛与优化器修复 5 案5
DrivingSDK自动驾驶 SDK,稀疏算子精度与优化 4 案4
memcacheKV 缓存池化,安全/事件/时延 7 案7
msmemscopeNPU 内存采集,口径对齐与样例适配 4 案4
msprobe精度调试工具,适配边界与工程化 4 案4
msinsight训练可视化,交互增强与时间对齐 6 案6

torchair(图编译器·融合放行、零拷贝折叠与回调可选输入)

七连档全收:A3 dtype 放开、融合错误放行收紧、torch2.10 折叠退化、C++/Python 回调可选输入同族两修

编号Issue 问题内容解答总结
#706dynamo_export导出OM的Data节点名为arg1_1等自动名,部署时无法按名绑定输入Data节点名由torch.compile在dynamo trace阶段自动生成,ATC的–input_shape、ACL SetDatasetBuffer与dump调试均消费该名,语义不可辨。修复!3675支持导出时自定义Data节点名称(merged 09-17),merge与关单秒级联动。KG dynamo_export接口文档可查该特性上下文。
#790A3上broadcast算子int64输入报D_INT64 is not supported nowonerec1.3B在A3上报Infer dtype failed for graph_hint/broadcast。修复!3705移除A2/A3上broadcast的int64 dtype lowering限制(merged 09-17),PR正文显式Fixes #790,D_INT64输入经新路径正常推导dtype。
#791DeepSeekV4整网开reduce融合后出现nan,系融合规则错误放行所致排查确认pointwise+reduce融合存在错误放行问题,错误组合进入融合kernel产生nan。修复!3707收紧pointwise+reduce融合放行条件(merged 09-17),PR正文Fixes #791,merge与关单秒级联动。
#792torch2.10延迟matmul分解使非连续LHS零拷贝折叠失效,FiBiNET性能劣化2.10函数化阶段改变分解条件、延迟aten::matmul decompose,非连续LHS本可零拷贝reshape折叠却未折叠,退化为broadcastTo+batchmatmul+transpose。首版!3695被关闭,!3717放宽折叠判断、允许非连续LHS零拷贝视图折叠(merged 09-18)。matmul常量折叠原理见KG微信CANN专栏。
#793C++回调代码用GetInputTensor取可选输入,未实例化时取值错位致精度/执行失败is_optional张量参数未传时仍按位置调用GetInputTensor(cur_input),索引错位。修复!3711重写输入张量获取逻辑、支持可选输入缺省处理(merged 09-17),分支名fix_cpp_custom_op_callback_optional_input直接对应。GetInputTensor语义见KG GE C++ API文档。
#799python回调不能正确处理可选参数None与torch.dtype类型输入与#793同族缺陷的Python侧:converter未把None可选输入映射为缺失输入,dtype值亦未归一化。修复!3718确保None正确映射缺失输入并添加dtype归一化逻辑(merged 09-20),分支fix_torch_dtype_converter;两单相隔3天先后修C++/Python侧。
#800静态编译先单算子预跑整图取JSON,原地算子场景产生副作用重复执行static_kernel_compile需dump算子JSON而预跑一遍图,含inplace算子时输入被多改一遍、结果精度错。修复!3722将单算子调用结果作为第一个step输出返回、避免二次执行副作用(merged 09-20)。复现用npugraph_ex backend加disable cache选项;静态编译调优见KG文档。

pytorch(NPU 适配深水区·存储拷贝、默认配置与错误码泛化)

TypedStorage deepcopy 丢 dtype、inductor 强制 trace 拖慢编译、错误码 reason 泛化落地,附 torchao 桥接 RFC

编号Issue 问题内容解答总结
#2797310P上set_device额外多占0号卡;缺Ascend910_9363芯片类型定义双诉求两组MR落地:!41582-86修310P重复设备初始化(npu_lazy_init时序调整,首版!40651-56关闭未合),!41580与!41587-91新增910_9363芯片类型及310P默认模式,PR正文链接#2797。7月中下旬全部merged,9-18才关单——stale关单时序差约2个月,回溯merged_at方能还原真实修复时点。芯片型号体系见KG IndexSDK文档。
#3951HCCL/ACL报错仅打印错误码无reason,用户需另查手册定位RFC泛化error_code_map:NPUErrorCodes.h新增HcclErrorCode(24码)/StressDetectErrorCode(4码),16处error code is日志检索map拼接reason。已落地:!46136(master)+!46452-56五分支09-17同刻merged,PR勾选项显式关联本issue。HCCL故障码定位见KG故障诊断指南。
#4242torchao量化库CUDA算子强绑定,NPU缺官方适配路径,提案新建ao仓桥接RFC设计out-of-tree桥接层:config/wrapper_tensor/strategy三层抽象,把npu_quantize/npu_mxfp8_mm等原生算子接入torchao流程;评论区补充torchao_npu目录结构。尚无merged实现:ao仓未创建,4个test MR仍open且关联pytorch-ecosystem #41/#42而非本RFC。
#4510uint8存储的float16视图deepcopy时NPU报错,dtype信息丢失uint8存储上float16视图deepcopy报错:storage.py的_deepcopy经_tensor_construct_from_storage重建张量时丢Half dtype、按底层uint8存储推导。报告人附完整调用栈及第5章修复方案;!46316(master)+5分支backport全部merged 09-16。修复晚关单4天,stale关单。
#4860inductor配置默认使能trace.enabled=True带来额外编译耗时inductor配置默认使能trace拖慢编译链路。修复!46409移除强制Inductor tracing并调整默认值,master与4个维护分支同日merged 09-17,PR正文直接贴本issue链接;issue次日关闭。属默认配置不当的性能回归类修复。

MindSpeed-LLM(大模型训练套件·日落公告与训前口径)

MindSpore 后端日落、v1 转换下架、mg018 对齐、GLM-5 调优,配镜像选择与 hf2mg 语义答疑

编号Issue 问题内容解答总结
#1691tests/tools缺__init__.py,import报ModuleNotFoundErrorPR4949(正文Fixes #1691,分支名fix/issue-1691-tests-tools-init-py):补齐tests/tools及ckpt_dequant下的__init__.py使其成为正式包,修复deepseekv4_ckpt_dequant.py导入quantize_mx等符号报错。09-17 10:33合入,当天14:24带确认评论关单。
#1826convert_ckpt限transformers≤4.57,requirements却锁5.2.0官方确认v1已下架:master于08-03提交f107818f删除ckpt-v1,根目录仅剩convert_ckpt_v2.py(26.1.0分支暂仍并存v1);transformers 5.x统一走v2转换,requirements特意限制5.2.0即为此。评论区解答后无跟进,09-19由stale流程自动关闭。
#1842在线预处理按文件名含_text_document扫目录选缓存,同目录多数据集时误加载PR5031(正文Fixes #1842):转换结束后的目录扫描接受任意含_text_document的文件名,会吃到无关数据集;改为preprocess_data.py写原子输出清单,训练初始化校验并只消费本次handler实际生成的bin/idx,支持多key、多原始输入与n_subs合并输出。09-11合入,09-20关单(晚9天)。
#1859GLM-5(744B,4K,A3)预训练通信开销偏大,性能待优化PR5049/5050(master+26.1.0双分支):TP 2→1(PP=8、EP=64不变)降低通信开销并同步改HF转换脚本;使能fused lightning indexer前反向算子(–use-fused-lightning-indexer[-loss]);index-topk 256→1024。注意TP=2时期旧权重需按新脚本重转。合入与关单秒级联动。
#1863DSV4训练入口未对齐上游Megatron-LM 0.18的pretrain/train重构PR5042:pretrain_deepseek4.py改model_provider(model_builder)委托,接入cfg_container、hybrid context parallel、进程内重启、ft_integration容错、E2E启动指标与modelopt钩子;loss_func返回上游三元组,training.py按上游签名重写。09-17合入与关单同秒。
#1867MindSpore后端日落:MindSpeed-LLM停止MS框架支持并移除存量代码公告单+PR5058:删除docs与examples的mindspore、mindspeed_llm/mindspore、tests/mindspore及–ai-framework mindspore注册;rlhf_gpt.py移除MS分支。PyTorch后端不受影响;套件同步日落(MS !3993、MS-MM !3159、Core-MS !764)。在用MS后端可留言评估迁移。同秒关单。
#187326.0.0误拉py3.12镜像,cpython-311后缀的so在预训练时报错官方答复:26.0.0镜像仅配套py3.11(A2:26.0.0-910b-…py3.11、A3:26.0.0-a3-…py3.11),文档已写明按需拉取;makefile按镜像内py版本编译,选py12则so后缀不匹配。属镜像选择问题,文档不另加备注。解答后即关单。
#1875quick_start的CKPT_LOAD_DIR填原始HF权重报找不到safetensor文件官方答复:pretrain_qwen3_8b_4K_ptd.sh默认未开自动转换,须填离线转换后的MG权重路径;加–enable-hf2mg-convert才加载HF原始权重且开启后不支持离线MG权重(train_from_hf.md约束)。属参数语义误解,文档无需改。

MindSpeed(核心加速库·治理收敛与优化器修复)

MindSpore 后端联动日落、DSK V4 细粒度重计算、9.1.0 镜像、特性管理统一与 Swap-Muon 真修复

编号Issue 问题内容解答总结
#241Swap-Muon 载入 ckpt 后 momentum 恢复异常;Layout 无 UT根因:load_state_dict() 替换 state 后 _state_map 仍指向旧 state。!3857 修该 bug,补 CPU 参数化 Pipeline Layout UT(含 MTP/非法配置)与双卡 ckpt 破坏-恢复闭环 UT,默认 Swap UT 由 8 卡降至 2 卡提速 CI;08-28 合入,20 天后 stale 关单。
#264MA 与 MindSpeed 双端各自维护 FEATURES_LIST,重复实现易漂移!3865:MindSpeedFeaturesManager 删独立清单与 apply 覆写,特性经 add_feature 注册进 MA 统一清单;参数钩子单层化(parse/validate 仅 MA wrapper 注册);patch_utils 复用 MA Patch 类净删约 90 行;08-14 合入,35 天后 stale 关单。
#289DSK V4(DeepSeek V4)细粒度重计算 RFC:降峰值 NPU 显存!3619 落地:新增 --recompute-csa-attention(CSA 重计算)与 --mhc-recompute(融合 MHC 重计算),支持常规 Transformer 与 MoE FB overlap 路径,适配 PP layout/MTP/norm 重计算,G2 命名统一为 CSA;08-24 合入,25 天后 stale 关单。
#290构建以 CANN 9.1.0 为基础的 MindSpeed Core Docker 镜像!3875/!3891 于 08-24 合入:CANN 基础镜像升级 9.1.0、新增 A5 镜像、support_tag 对历史镜像归档、镜像 tag 模板优化;25 天后 stale 关单。镜像说明见仓内 docker/OVERVIEW 文档。
#336MindSpeed 核心仓 MindSpore 后端日落:停开发停支持并移除适配层!3993 删 mindspeed/mindspore 适配包、双语文档、UT、–ai-framework mindspore 注册与 ms 门禁脚本,仅留 PyTorch 后端;套件联动日落 MindSpeed-MM !3159 / LLM !5058 / Core-MS !764;merged_at 与关单同秒(17:38:22),秒级铁证。

DrivingSDK(自动驾驶·稀疏算子精度与优化设计)

A5 voxelFeats 未初始化实锤、SubmSparseConv3d 越界文档先行、loss 口径答疑与 RoiawarePool3d 优化 RFC

编号Issue 问题内容解答总结
#340RoiawarePool3d 前向优化 RFC:降重复计算、GM 访存与流水等待设计评审通过关单;实现 !2265:ROI 坐标/angle/点坐标重排为 NPU 友好布局,UB 内批量缓存 sin/cos 并完成点变换与有效点筛选,GatherMask 收集索引,每点特征仅 GM 搬运一次,max/avg pooling 分支分离。截至 09-20 仍 open 合入中。
#368910b+CANN8.3.RC1 下 SubmSparseConv3d 特定输入崩 507015aicore 内核 MTE DDR 地址越界(vec/mte error)。官方索要 batchsize/spatial_shape/num_point 未获回复;先合入 !2326 增加 sparse/subm 系列 shape 约束文档(09-14),内存越界修复 !2324 截至 09-20 仍 open;09-18 以缺乏输入无法复现 stale 关单。
#373Diffusion-Planner 950 FP32 训练 loss 与 README 基准无法对齐实跑 30 轮 loss 0.0619,较 README 竞品 A100 0.1631 低 2.6 倍。官方以最新版复测 A5/A2 未见精度异常后关单,无修复 PR;报告者逐 epoch 分析:950 第 5 轮 loss 0.1628 与 A100 最终值几乎重合,疑 README 基准为早停/检查点口径而非 30 轮终值,属对比口径问题而非精度劣化。
#374A5 上 dynamic_scatter 精度异常、UT 不过(CANN 9.1.0)根因:A5 分支 voxelFeats 未初始化即累加,引入脏数据致精度异常;!2344 补初始化修复,A5 atk 与 A2 共 200 个 UT 用例验证通过;merged 15:25:38 后 4 分 17 秒关单,秒级铁证。

memcache(KV 缓存池化·安全、事件广播与时延优化)

私钥明文高危、kvevent 完整广播、主备切换刷屏聚合、rank 淘汰打散与 layerwise 四项提速

编号Issue 问题内容解答总结
#310ZMQ通道加密时mmc-meta.X.log打印明文私钥PR592:configuration增加sensitive data region,拉起打印配置时对该区域隐藏显示(私钥打码);含UT看护。merged 09-18T14:06:39,issue同秒自动关闭。修复前私钥全程明文可被日志采集外带,安全高危。
#327kvevent仅广播seq_hash,需完整key广播供预取PR611:kvevent改为广播完整key names,为上层服务框架预取功能供数;与#328同一PR修复,merged 09-18T14:07:15,两单同秒自动关闭。feature单以实现落地关单。
#328kvevent不广播SSD存入与删除blob事件根因:SSD双写版本后不走EvictCallBackFunc,原打点位置失效致conductor状态不一致。PR611改在AddSsdBlob()广播存入、删除回调补removed打点;含UT。
#330主备meta切换后BM重放blobList致日志刷屏PR615:主备切换/重启后BM重连重放全量blobList,多介质blob在各异介质分配器BuildFromBlobs逐条打WARN(属预期路径)致刷屏;改为聚合BM重注册时打一条聚合日志。merged 09-20T11:49:13同秒关单。
#333最佳实践文档理论命中率64%计算方式看不懂官方答疑(han-sanyue评论):aisbench压测未加预热参数,每条前缀共出现5次仅其中4次有80%命中率,平均理论命中率=80%×(4/5)=64%。纯答疑无代码改动,答疑7分钟后即关单。
#336重拉meta后各rank淘汰不均,部分rank至99.99%无法淘汰PR614:重启后汇聚数据按rank插入全局LRU,淘汰集中于固定rank且影响SSD回温;改为每插入一个rank即打散各LRU,保证均匀淘汰。合入release/1.2,merged 09-18T19:30:25同秒关单。
#337layerwise下batch_get_key_info时延大,推理现空泡PR617四项优化:PrefetchKeys传参拷贝75us改引用传参;不开SSD时跳过无效container查询(原耗10ms以上);resp.batchQueryInfos_预留免重复扩缩容;框架侧保租约后layerwise支持gva免校验。merged与关单同秒。

msmemscope(NPU 内存采集·口径对齐与样例适配)

一 PR 三修:process_used 口径、GIL 死等、打印与落盘路径;另附 507035 样例适配

编号Issue 问题内容解答总结
#132process_used与npu-smi进程占用相差近3倍PR261:部分环境process_used无法采集。重构ASCEND_RT_VISIBLE_DEVICES解析为惰性EnsureEnvParsed(),镜像runtime GetVisibleDevices规则,仅受限模式才做user→real设备号转换。回归后149508096B≈npu-smi的142MB,报告者确认通过。
#142样例leaks/c编译后采集报aclError:507035PR262(案例报错):旧样例kernel在新环境(CANN 9.2/ccec编译链)报错;样例改为不依赖特定kernel、只验证工具能力。属样例适配非工具缺陷,报告者重新编译+采集回归通过。
#144host采集设PYSTACK_LIVE_BYTES后执行卡住PR261:为Python栈采集增加GIL身份门避免采集死等;新增无调用栈的影子模式ReportHalCreate重载并修正halMemCreate影子上报来源。报告者单卡场景编译自验+回归通过。
#145host采集打印难懂,且未打印落盘文件路径PR261优化host内存采集打印信息并输出落盘文件路径;同PR一并修复process_used采集(#132)与python栈卡死(#144),PR正文显式关联三单。报告者回归验证通过。

msprobe(精度调试工具·适配边界与工程化)

DTensor 绕行指引、debug 日志补齐、devcontainer 一键环境与 yaml skill 说明

编号Issue 问题内容解答总结
#293dump工具debug日志少,采集异常难定位PR873:增加debug日志覆盖forward_pre_hook/forward_hook等关键函数是否执行、属哪一api/module,并打印整体配置;部分info/warning日志切换为rank_0输出防多rank刷屏。7月13日合入,9月随任务池单stale收尾关单(社区共建,SSMTX认领实现)。
#571msprobe缺一键式开发容器构建环境PR997:基于devcontainer统一开发环境——一键构建容器、CMake补齐Debug编译支持、build.py增加只下载依赖功能;配套使用资料说明PR1020(#584)09-08合入。提交者附自验截图。09-03合入后随stale关单(晚16天)。
#579DTensor训练dump md5报element_size无布局推导注册官方确认(kun_8):工具暂未适配hyper_paralle自定义tensor;绕行指引——在msprobe/core/dump/data_dump/data_processor/pytorch_processor.py中对自定义tensor做简单适配(附代码位置截图)。无PR,resolved后随stale流程关闭。
#602旋转激活权重还原yaml缺自动化生成说明PR1051:增加比对支持旋转激活权重还原的配置文件yaml可用skill自动生成的资料说明。merged 09-18T11:19:56.544,关单11:19:56.557——merge触发自动关单,间隔13毫秒。

msinsight(训练可视化·交互增强与时间对齐)

WASD 导航、切换工程防御、i18n 订阅刷新、Baseline 卡 25 秒偏差与两案渲染修复

编号Issue 问题内容解答总结
#546metrics甬道没有按host和device偏移量正确移动PR1046「metrics适配host和device偏移」(标题语义一致,issue创建即挂链):metrics泳道按host/device各自offset对齐移动。09-09合入并resolve,此后无更新,09-18由stale流程自动关闭(较真实修复晚9天)。
#574text场景下全量连线显示错误PR1123「修复text场景下全量连线」(标题与issue逐字一致+创建当天挂链,语义匹配):修复text场景全量连线渲染错误;09-16 15:02合入,09-20随批次清理关单(晚4天)。
#577memscope与snapshot切换时报Invalid deviceId空参数PR1154/1162(master+26.2.0,分支fix/memory-project-switch-577):切换工程时设备状态短暂置空,此前排队的防抖回调与事件分页仍发请求;改为设备未就绪时拦截图表/详情/表格请求,Snapshot不再触发MemScope专属请求。09-18合入,09-20回归(20260920_0100版)通过后关单。
#578Memory页签对比状态表格时间异常,多节点差值带约25s开机偏差PR1152/1157:!836给全量DB基线卡引入Baseline_独立cardId后,Memory对比仍用它查TraceTime offset,而时间戳登记在原始rankId且基线不再重Parse,offset归零;修复为找不到Baseline_*时回退原始rankId,已解析基线补登记UpdateStartTime,新增TraceTimeTest看护。
#579通信算子缩略图仅靠鼠标/滑块导航,密集算子与跨Rank对比操作繁琐PR1151/1159(master+26.2.0):增加与Timeline一致的WASD导航——W/S按可见范围1.2倍缩放、A/D平移约10%,Shift+W/S缩放Rank轴、上下方向键按整行移动;缩放锚定鼠标位置,仅图表聚焦时生效,忽略输入法与修饰键组合,Esc退出。合入后5分钟关单。
#580慢卡高亮的"按通信算子尾部对齐"提示不随中英文切换更新PR1165(正文Fixes #580)/1166(26.2.0):弹窗打开时经i18n.t固化文案,改为react-i18next的Translation组件订阅语言变化,标题/说明/"知道了"按钮随切换刷新;保留原5秒展示时长。09-18合入,09-20回归通过后关单。

组合解读:这 50 条增量里的共性规律

1. torchair 编译链七案:放行条件、折叠机会与回调契约三类边界。
该放的没放(int64 lowering)、不该放的放了(融合 nan)、该折叠的没折叠(torch2.10 退化),回调可选输入 C++/Python 两侧先后修——坑都在边界判断上。

  • ta#706 dynamo_export 导出 Data 节点名为 arg1_1 自动名:!3675 支持导出自定义节点名(同秒关单)
  • ta#790 A3 broadcast int64 报 D_INT64 not supported:!3705 移除 A2/A3 lowering 限制(PR 正文 fixes #790)
  • ta#791 DeepSeekV4 开 reduce 融合后 nan:pointwise+reduce 错误放行,!3707 收紧条件
  • ta#792 torch2.10 延迟 matmul 分解致非连续 LHS 零拷贝折叠失效:首版 !3695 关闭、!3717 放宽折叠判断接替
  • ta#793 C++ 回调 GetInputTensor 未实例化可选输入取值错位:!3711 重写获取逻辑(分支名实锤)
  • ta#799 Python 回调不能处理 None 与 dtype 输入:!3718 映射缺失输入+归一化(与 #793 同族隔 3 天)
  • ta#800 静态编译预跑整图致原地算子副作用:!3722 单算子结果作首 step 输出(同秒关单)

2. pytorch 深水区五案:修复走 master+backport 全分支,落地时点要回 merged_at。
三案都是 master+多维护分支同刻合入(四到六分支成组),而关单普遍晚数天到两个月;另有一案 RFC 零落地如实收录。

  • pt#4510 uint8 存储 float16 视图 deepcopy 丢 Half dtype:!46316+五分支 backport(09-16 合入、09-20 关单)
  • pt#4860 inductor 默认 trace.enabled=True 拖慢编译:!46409 移除强制 tracing+四分支
  • pt#3951 HCCL/ACL 报错只有码无 reason:!46136 新增 24+4 错误码、16 处日志拼接(勾选框显式关联)
  • pt#2797 310P set_device 多占 0 号卡+缺 910_9363 定义:!41580~!41591 七月合入,stale 关单晚约 2 个月
  • pt#4242 torchao NPU 桥接 RFC:config/wrapper/strategy 三层设计已评审,ao 仓未建、4 个 test MR 关联他单——零落地如实标注

3. MindSpeed-LLM 八案:一次日落公告与一串训前口径。
MindSpore 后端四仓联动日落是本批最大公告;v1 转换下架、mg018 对齐、GLM-5 调优之外,三条答疑都指向「按文档口径操作」。

  • msl#1867 MindSpore 后端日落:PR5058 删 MS 代码与注册,PyTorch 不受影响(同秒关单;MS/MM/Core-MS 联动)
  • msl#1826 convert_ckpt 与 transformers 5.2.0 版本冲突:v1 已于 08-03 下架、统一走 v2,26.1.0 分支并存属滞后
  • msl#1863 DSV4 入口未对齐上游 mg018 pretrain/train 重构:PR5042 接入 model_provider 委托与 hybrid CP(同秒关单)
  • msl#1859 GLM-5(744B,A3) 通信开销偏大:PR5049/5050 TP 2→1+fused lightning indexer+topk 1024(对 backport 同秒关单)
  • msl#1842 预处理按 *_text_document 扫目录误吃同目录数据集:PR5031 改 manifest 原子清单消费
  • msl#1691 tests/tools 缺 init.py 导入报错:PR4949 补包结构(分支名 fix/issue-1691 实锤)
  • msl#1873 误拉 py3.12 镜像致 cpython-311 so 报错:26.0.0 仅配套 py3.11,按文档选镜像
  • msl#1875 CKPT_LOAD_DIR 填 HF 权重报找不到 safetensor:默认须填 MG 权重,开 --enable-hf2mg-convert 才吃 HF

4. MindSpeed 五案:治理收敛与一个藏在 UT 需求里的真 bug。
特性清单双端归一、重计算粒度落地、镜像升版都是治理动作;Swap-Muon 单表面是补 UT,实际修掉 _state_map 指向旧 state 的恢复 bug。

  • ms#336 核心仓 MindSpore 后端日落:!3993 删适配层仅留 PyTorch(合入-关单同秒,与 LLM/MM/Core-MS 联动)
  • ms#289 DSK V4 细粒度重计算 RFC:!3619 落地 --recompute-csa-attention 与 --mhc-recompute
  • ms#290 CANN 9.1.0 基础镜像:!3875/!3891 升版+新增 A5 镜像+历史 tag 归档
  • ms#264 MA/MindSpeed 双端 FEATURES_LIST 漂移:!3865 特性统一注册进 MA 清单、净删约 90 行
  • ms#241 Swap-Muon 载入 ckpt 后 momentum 恢复异常:!3857 修 _state_map 失联+补 Layout UT 与双卡闭环

5. DrivingSDK 四案:算子精度实锤、文档先行与口径之争。
voxelFeats 未初始化是 A5 分支独有实锤;SubmSparseConv3d 越界文档先行、修复仍 open;loss 对不上 README 最后是口径之争。

  • drv#374 A5 dynamic_scatter 精度异常:A5 分支 voxelFeats 未初始化即累加,!2344 补初始化+200 UT(4 分 17 秒关单)
  • drv#368 SubmSparseConv3d 特定输入崩 507015:MTE DDR 越界,!2326 shape 约束文档已合、修复 !2324 仍 open
  • drv#373 Diffusion-Planner 950 loss 低于 README 基准 2.6 倍:官方复测无精度异常,疑基准为早停/检查点口径
  • drv#340 RoiawarePool3d 前向优化 RFC:NPU 布局重排+UB 缓存 sin/cos+GM 单次搬运,实现 !2265 进行中

6. memcache 七案:安全、事件语义与性能三线并行。
私钥明文是安全高危,kvevent 补齐完整 key 与 SSD 事件是能力补全,layerwise 四项优化把 10ms 级查询压下来。

  • mc#310 ZMQ 加密时日志打印明文私钥:PR592 敏感区域打码+UT 看护(同秒关单)
  • mc#327 kvevent 仅广播 seq_hash:PR611 改广播完整 key names 供预取(与 #328 同 PR 同秒关两单)
  • mc#328 SSD 存入/删除事件不广播:PR611 改 AddSsdBlob 广播+删除回调补 removed 打点
  • mc#330 主备切换后 BM 重放 blobList 刷屏:PR615 重注册改一条聚合日志(同秒关单)
  • mc#336 重拉 meta 后部分 rank 淘汰至 99.99% 卡死:PR614 每插入一个 rank 即打散各 LRU(同秒关单)
  • mc#337 layerwise batch_get_key_info 时延大:PR617 引用传参+跳过无效查询+预留扩容+免校验(同秒关单)
  • mc#333 理论命中率 64% 看不懂:压测未加预热,80%×(4/5)=64%(官方答疑 7 分钟后关单)

7. msmemscope 采集四案:一 PR 三修与一次环境跟进。
process_used 差 3 倍、Python 栈卡死、打印难读三单同由 PR261 收口;样例 507035 则是新编译链下的适配。

  • mss#132 process_used 与 npu-smi 差近 3 倍:PR261 重构 VISIBLE_DEVICES 解析镜像 runtime 规则
  • mss#144 设 PYSTACK_LIVE_BYTES 后采集卡住:PR261 加 GIL 身份门+影子 ReportHalCreate 重载
  • mss#145 host 采集打印难懂且无落盘路径:PR261 优化打印并输出路径(PR 正文显式关联三单)
  • mss#142 样例 leaks/c 报 aclError 507035:PR262 样例改不依赖特定 kernel,属新环境适配

8. msprobe 精度工具四案:适配边界讲清楚,工程化补齐。
DTensor 未适配给了绕行位置,debug 日志覆盖关键 hook,devcontainer 一键环境连配套文档一并落地。

  • msp#579 DTensor 训练 dump md5 报无布局推导注册:官方确认未适配 hyper_paralle,pytorch_processor.py 自行适配绕行
  • msp#293 dump 工具 debug 日志少:PR873 覆盖关键 hook 执行与归属(7-13 合入、stale 晚 68 天关单)
  • msp#571 缺一键式开发环境:PR997 devcontainer 容器+Debug 编译+依赖下载(配套文档 PR1020 并档)
  • msp#602 旋转激活权重还原 yaml 缺说明:PR1051 补 skill 自动生成资料(合入-关单差 13 毫秒)

9. msinsight 六案:交互增强与两处时间/渲染对齐。
WASD 导航是体验升级,Baseline 卡 25 秒偏差是重构遗留,metrics 偏移与 text 连线是渲染口径。

  • msi#579 通信算子缩略图导航繁琐:PR1151/1159 WASD 缩放平移+Rank 轴快捷键(合入后 5 分钟关单)
  • msi#577 切换工程报 Invalid deviceId 空参数:PR1154/1162 设备未就绪拦图表/详情请求(回归通过后关单)
  • msi#580 慢卡高亮提示不随中英文切换:PR1165/1166 改 Translation 组件订阅语言变化
  • msi#578 Memory 对比时间差约 25s:PR1152/1157 Baseline cardId 找不到时回退原始 rankId
  • msi#574 text 场景全量连线显示错误:PR1123 标题逐字一致(合入后 4 天随批次清理关单)
  • msi#546 metrics 泳道未按 host/device 偏移移动:PR1046 语义一致(stale 晚 9 天关单)

排错指引(从这批 issue 提炼)

症状第一优先动作本篇相关案例
导出 OM 输入名 arg1_1 无法绑定dynamo_export 已支持自定义 Data 节点名ta#706
A3 broadcast int64 报 not supported新版本已放开 int64 loweringta#790
开 reduce 融合后 loss nanpointwise+reduce 放行条件已收紧ta#791
升 torch2.10 后 FiBiNET 性能劣化查非连续 LHS 零拷贝折叠是否失效ta#792
自定义算子回调可选输入取值错位C++/Python 两侧缺省处理均已修ta#793、#799
静态编译后结果精度错单算子预跑对原地算子有副作用,结果已作首 step 输出ta#800
uint8 存储 float16 视图 deepcopy 报错TypedStorage 重建丢 dtype 已修pt#4510
inductor 编译链路偏慢强制 tracing 已移除,查 trace.enabledpt#4860
HCCL/ACL 报错只打印码新版日志已按错误码表拼接 reasonpt#3951
310P set_device 多占 0 号卡npu_lazy_init 时序已修pt#2797
torchao 量化想上 NPU桥接 RFC 未落地,关注 ao 仓动态pt#4242
convert_ckpt 报 transformers 版本冲突v1 已下架,统一走 v2 转换msl#1826
训练吃到同目录别的数据集目录扫描已改 manifest 原子清单msl#1842
ckpt_dequant 脚本 import 报错tests/tools 补 init.pymsl#1691
在用 MindSpore 后端四仓联动日落,留言评估迁移msl#1867、ms#336
DSV4 训练入口与上游不一致pretrain_deepseek4.py 已接 mg018 重构msl#1863
GLM-5 A3 通信开销大TP 2→1+fused lightning indexer+topk 1024msl#1859
预训练 so 后缀 cpython-311 报错26.0.0 配套 py3.11,按文档选镜像msl#1873
CKPT_LOAD_DIR 填 HF 权重报错填 MG 权重或开 --enable-hf2mg-convertmsl#1875
DSV4 显存峰值高开 --recompute-csa-attention / --mhc-recomputems#289
找 MindSpeed Core 镜像9.1.0 基础+A5 镜像已就绪ms#290
特性清单双端不一致特性统一经 MA 注册管理ms#264
Swap-Muon 载入 ckpt 后 momentum 异常_state_map 指向旧 state 已修ms#241
Diffusion-Planner loss 对不上 README疑基准为早停/检查点口径,非精度劣化drv#373
SubmSparseConv3d 崩 507015shape 约束文档已合,越界修复跟踪中drv#368
A5 dynamic_scatter 精度异常A5 分支 voxelFeats 未初始化已修drv#374
RoiawarePool3d 前向偏慢NPU 布局重排+UB 缓存方案实现中drv#340
ZMQ 加密私钥进日志敏感区域打码已合入mc#310
预取拿不到完整 key/SSD 事件kvevent 已广播完整 key 与存删事件mc#327、#328
主备切换后日志刷屏BM 重注册改一条聚合日志mc#330
重拉 meta 后淘汰不均每插入一个 rank 打散各 LRUmc#336
layerwise 推理现空泡引用传参+跳过无效查询+预留扩容mc#337
命中率 64% 看不懂未预热时 80%×(4/5)=64%mc#333
process_used 与 npu-smi 差数倍VISIBLE_DEVICES 解析已镜像 runtime 规则mss#132
PYSTACK_LIVE_BYTES 采集卡住GIL 身份门已加mss#144
样例采集报 507035样例已不依赖特定 kernelmss#142
DTensor dump md5 报错pytorch_processor.py 自行适配绕行msp#579
dump 异常难定位debug 日志已覆盖关键 hookmsp#293
搭 msprobe 开发环境devcontainer 一键构建msp#571
旋转激活权重还原 yaml 不会写可用 skill 自动生成msp#602
Insight 切工程报空 deviceId设备未就绪拦截请求已修msi#577
Insight 弹窗文案不随语言切换Translation 组件订阅已修msi#580
密集通信算子导航繁琐WASD/Shift+方向键导航msi#579
Memory 对比时间差约 25sBaseline cardId 回退原始 rankIdmsi#578
text 场景连线错乱全量连线渲染已修msi#574
metrics 泳道不对齐按 host/device 偏移对齐已修msi#546

考据与口径披露

  • 增量口径(二):本篇为 2026-09 增量补采续篇——上篇(十六)从有效池 243 条取头部 63 条,本篇从余量按仓取 65 条(torchair 7 候选+pytorch 7+memcache/msmemscope/msprobe 19+MindSpeed-LLM/msinsight 18+DrivingSDK/MindSpeed 14),四批 worker 深析留 52,主编层并档 1(msprobe#584 配套文档 PR1020 并入 #571 行)与裁撤 1(msmemscope#148 纯 readme 文档单)后恰 50 入选;worker 层弃 13。兑现上篇预告的 pytorch 精选与 torchair/memcache 小仓连档。
  • KG 核实:机制/口径核对走昇腾知识图谱(ascend.wiki)——ta#800 命中静态 kernel 编译调优文档与 npugraphex skill、ta#793 命中 GE GetInputTensor API、pt#3951 命中 HCCL 故障码诊断指南、msl#1875 命中官方答复所引 train_from_hf.md(0.940)、msl#1859 命中 sparse_lightning_indexer 算子文档、drv#368 命中 SACT 迁移知识库 spconv 不兼容背景、drv#340 命中 RoiawarePool3d 源码节点、ms#241 命中仓内 swap_muon.py 源码等;50 行中 32 行挂 kg_refs,18 行无有效命中留空未硬凑。
  • PR 合并判定:一律以 pulls API state=merged+merged_at 判定(merged 字段恒为 null)。本篇特殊载体六例——pytorch#4242 RFC 零落地(ao 仓 404 未建、页面 4 个 test MR 关联 pytorch-ecosystem 他单);drv#368 修复 !2324 至今 open(shape 约束文档 !2326 已合);drv#340 实现 !2265 open(设计评审通过即关单);ta#792 首版 !3695 closed 由 !3717 接替;pt#2797 首版 !40651-56 closed 未合;master+backport 多分支成组合入(pt#4510 !46316+五分支、pt#4860/pt#3951 五分支、msl#1859 与 msinsight 四组双分支)。抽 28 条硬时序断言对 API 复核通过(17 条自动关单链 + 11 条 stale/分钟级对照)。
  • 关联依据分层:合入-关单秒级自动关单链 17 条(torchair #706/#790/#791/#793/#799/#800、memcache #310/#327/#328/#336/#330/#337、msprobe #602 差 13 毫秒、MSL #1867/#1863/#1859 毫秒级、MindSpeed #336 同秒);分钟级(drv#374 差 4 分 17 秒、msi#579 差 5 分钟);一 PR 多单(memcache PR611 同修 #327/#328、msmemscope PR261 三连修 #132/#144/#145);分支名实锤(ta !3711 fix_cpp_custom_op_callback_optional_input、msl !4949 fix/issue-1691-*、msi !1154 fix/memory-project-switch-577);PR body 显式(ta fixes #790/#791、pt 勾选框「关联 #3951」、msl Fixes #1842/#1691);stale 关单(pt#2797 晚约 2 个月、msp#293 晚 68 天、ms#264 晚 35 天、#289/#290 晚 25 天、msi#546 与 msl#1842 晚 9 天);评论解答(mc#333、msl#1826/#1873/#1875、msp#579、drv#373)。
  • 时序陷阱实录:①stale 关单依旧普遍——resolve 后 ascend-robot 4 天无更新自动关闭,本批极值 pt#2797 晚约 2 个月、msp#293 晚 68 天,判据一律回 PR merged_at;②反向时序两例(均弃收行)——MindSpeed#338 关单早于 PR 合入 18 小时(建 PR 即关单)、DrivingSDK#375 关单早于建 PR 35 秒且 PR 至今 open,「关单」与「合码」可任意先后;③pytorch 仓 09-20 11:29:01~11:30:22 出现 91 秒三连关(#4242→#4510→#3951),而 #4510/#3951 修复完成于 09-16/17——批量关单簇不能倒推修复时点;④DrivingSDK 09-18 15:00~17:06 八单批量关单簇中三条 CI 试点收尾(#351/#352/#372)按操作者聚合归因弃收;⑤「页面挂 merged PR」≠修复本单(#352 页面挂 !2342 实修 DiffusionDriveV2 脚本、正文无 Closes);⑥同秒关单是 merge 钩子行为、与内容价值无关(弃收行 #1876/#1879 亦同秒)。
  • 诚实弃收:worker 层弃 13——pytorch #4789(version bump 任务单)、#4917(docs 编辑单);msmemscope #147(CI 自提);msprobe #583(仅转引上游 vllm-ascend#8992,经 proxy 核实仍 open);MSL #1874(无实质内容)、#1876(删冗余 chore)、#1879(纯改名);msinsight #430(零修复证据);DrivingSDK #372(CI 插件升版)、#352(CodeQL 试点,真 PR closed)、#351(安全编译试点)、#375(AIDD 占位);MindSpeed #338(AIDD 勘误)。主编层处置 2:msprobe#584 并档 #571、msmemscope#148 裁撤(双分支 readme 文档单已合入,无排错密度)。
  • 候选统计与余量:有效池 243 条两篇已采 128 条(上篇 63+本篇 65),余约 115 条待续——msagent/msopprof/msprof/ascend-deployer/asc-devkit/ops-rec/TransformerEngineNPU/VisionSDK/op-plugin/hcomm 等小仓连播与两篇已采仓的尾单,可再支撑 2~3 篇增量专刊。

接入昇腾知识图谱 https://gitcode.com/agent0/kg-tools

系列下一篇:增量池第三棒——观测与部署小仓连播(msagent/msopprof/msprof/ascend-deployer 等)或指定仓专刊,欢迎留言点向。

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐