v1.0: 补摘要

This commit is contained in:
2026-08-26 11:34:49 +00:00
parent ad6a92fdde
commit 1b14a201e9

View File

@@ -2,6 +2,10 @@
> 目标芯片:昇腾 950PRDAV_3510。理论分析基于《BMM 算子优化分析 v0.96》,源码参考 [cann-ops-nn](https://gitcode.com/cann/ops-nn/tree/master/matmul/batch_mat_mul_v3) 实现。 > 目标芯片:昇腾 950PRDAV_3510。理论分析基于《BMM 算子优化分析 v0.96》,源码参考 [cann-ops-nn](https://gitcode.com/cann/ops-nn/tree/master/matmul/batch_mat_mul_v3) 实现。
## 摘要
BMM 中当 B ≥ C 时核间切 B 免费,核内有 IterBatch逐 batch和 MergeBatch合并 $b_0$ 个 batch两种路径。本文从 GM→L1 搬移粒度差异出发,证明 MergeBatch 的核心优势是**合并搬移减少 DMA 命令数**(每次搬移有固定开销 $T_{cmd}$),核心劣势是 **drain 暴露放大 $b_0$ 倍**。分界条件MergeBatch 仅在 **K 截断**$k_{L1} = K$,小 M/N且 $b_{core}$ 足够大时优于 IterBatch**L1 绑定情形($k_{L1} < K$MergeBatch 恒劣于 IterBatch**。与源码对比发现源码 MergeBatch 进入条件偏宽缺搬移量/tile/算存比约束IterBatch 只覆盖 L1 形态 b a/c/d)。
--- ---
## 一、问题定义 ## 一、问题定义