| register_replacement pattern 命中≠收益:kernel diff → 逐 pass AB → R1-R5 根因目录(含"负收益先查 kernel 形态"教训) | pattern-dev/references/benefit-rootcause-guide.md |
| kernel diff 方法论:kernel_details.csv 聚合对比、L2-flush bench 必须放计时区外、warm/cold 双档测量 | 计时口径单点 benchmark-dev/references/benchmark-guide.md;聚合对比见 pattern-dev/references/benefit-rootcause-guide.md §2 |
| 模型级验证闭环(不只看单测):双层测试与图验证、eager×compile kernel diff、远端 NPU 部署流程 | pattern-dev/references/test-templates.md、pattern-dev/scripts/compare_profiles.py、env-install/SKILL.md、dummy-run/ |
| MiniMax-H3 算子上下文(npu_swiglu 语义、表 [3,D] L2 驻留、真实图形态) | dummy-run/references/minimax-h3-notes.md §10 |
MindIE-SD/CANN 集成侧经验:kernel 改动"没生效"排障(tiling-key .o 缓存/全清重建/sentinel 法)、CANN 同名内建算子冲突与改名陷阱、AscendC bf16 Muls/Gather 语义坑、triton 短行地板判定、w8a8 与融合 pattern 冲突;融合收益前置评估已归 fusion-scope-analyze(实现前/中向它取收益评估结论),本文件只留集成侧事实与坑 | references/mindiesd-fusion-notes.md |
自研算子运行期部署校验:inferShape function does not exist(import mindiesd 顺序 / 算子包未进运行 CANN)、"跑的是不是我改的 kernel"(sentinel / 计数)、golden 通过判据(阈值以各 op 的 golden 文件为准) | references/custom-op-runtime-deploy-verify.md(顺序机制真源在 framework-integration/SKILL.md §1.5) |
| 外部/三方 AscendC kernel 接入 mindiesd 内部(catlass 类):形态选型(单 .so ASC 混编为终态)、CMake/ASC 链接与静态运行时链接坑、torch custom op C++ 形态(tuple 返回/PrivateUse1/stream)、设备/运行时事实、集成侧数值验证(位级仅 h3 特例,一般融合为 fp8 量化级;接入 compile 图的约束与 compile 前后收益核验归 pattern-dev) | references/catlass-kernel-integration.md |
| 只读 catlass 融合算子全链开发(量化 matmul+激活+输出量化,vendored 头、standalone 对拍计时、mindiesd 集成、compile GraphPatternEntry 真图使能、开关治理):六段流水线与决策;落码前先做 §2.1 片上资源预算(三行算术:累加器份数 ≤ L0C / 操作数常驻 ≤ L1,本仓两例方案都是"容量上不存在") | references/catlass-ffn-fusion-guide.md |
| mm_gelu_mxquant(FLUX/Wan/Qwen)案例细节:真实图链/bias=0/装载 API 坑/计数与 AB/工程坑 | references/mindiesd-fusion-notes.md §7(集成侧要点)+ references/mmgelu-flux-wan-qwen-case.md(案例细节记录) |
| 环境事实:设备 fp64 在本环境真实可用(推翻旧记载的"被静默降级为 fp32":可分辨 fp32 表示不了的最小增量、设备 vs CPU 的 fp64 sum/mean 逐位一致)⇒ 需要高精度参照时可直接用 fp64;警告文本 ≠ 事实,一律实测 | references/triton-ascend-lowering-pitfalls.md(§三 归约逆向用得上 fp64 参照) |
| 库归约的逆向方法:先判"形状相关性"(改调用内份数看结果是否变)⇒ 再按族穷举(相邻配对 / 对折 / 跨步 / 分块);本仓在相邻配对族试数十种全败、换对折树一个式子逐位命中 | references/triton-ascend-lowering-pitfalls.md §三 |
per-program 固定成本受限("更少更胖的 program"):耗时与工作量不成比例、却与 program 个数成比例;识别(判型第三类 + D1–D4 检测器)归 fusion-scope-analyze;修法(减少 program 数、并发在飞装载、preload vs unroll 的分辨、num_stages 无效时的处置、跨 rank 整除性守卫) | 识别 ../fusion-scope-analyze/references/fusion-benefit-method.md §1.1;修法 references/per-program-fixed-cost.md |