Files
matmul-analysis/BMM/BMM_Theory/docs/02_分支理论/01_MergeBatch分支.md
admin 18f59599e7 Fix #31/#32: 切B类GM每字节恰一次=V_in(去K切分整段上取) / ASW场景升级(单侧全驻留+对侧滑窗->S_B, S_C最小替换2D分组+窗口L2计账) / 06文档§3+Step5与docs/05同步
#31 IterBatch/MergeBatch: K切分各(batch,K段)互不重叠+驻留侧每batch一次+末段按实际剩余
    -> GM读取量=V_in(与L2容量无关), GM数据时延=V_in/W_GM; n_K仅决定DMA命令数(T_cmd)
    b64_m16_n256_k512 形态c: GM 25.07MB->17.83MB=V_in; 回归: 形态c/d非整除+L1绑定三类断言
#32 ASW: (1)S_B扩展单侧全驻留+对侧滑窗(a_b/b_b+2*对侧单块<=L2) -> GM=V_in, 6个场景C行回落S_B;
    (2)S_C在整L2容量约束下搜索最小GM=ceil(n_cnt/n_grp)a_b+ceil(m_cnt/m_grp)b_b(取代L2/2对半预算),
    并计组内窗口L2流量((n_cnt-ceil)a_b+(m_cnt-ceil)b_b), 与S_B'驻留命中走L2'口径一致;
    b8_m131072_n8192_k8192 GM倍率4.76x->3.88x(物理下界~3.9x, 双侧均超L2)
    大方形K行(如b128_m8192_n8192_k7168)由MMAD 253ms->MTE2(L2口)295ms: 共享块重复读1.38TB
    经L2读口5.2TB/s, 如实计账(原C窗口流量零计低估)
- docs/06 §3与Step5重写为S_A/S_B/S_C+两段链口径(旧r_in单段/除B/对半预算口径废弃)
- docs/05 R5/R6/§3.1/§4.1/§4.3/§5与docs/01、02(01_MergeBatch/02_IterBatch GM口径附注)同步
- tests 54/54; 压力seed7/6000+seed2024/4000: 0违规/0占位/0NaN/0GM<V_in; examples重生成0diff
2026-09-04 17:12:47 +08:00

3.9 KiB
Raw Blame History

MergeBatch 分支理论

整理自《BMM算子优化分析 v0.98》§五 + 《MergeBatch_vs_IterBatch分析 v1.1》§三/§四. 对应软件实现: bmm_theory/branches/merge_batch.py.

1. 一句话本质

核间切 B每核 b_core = B/C 个 batch核内把 b₀ 个 batch 合并成大矩阵做单次 DMA 搬入、一次计算、一次写回:

[b_0 M, K] @ [K, b_0 N] = [b_0 M, b_0 N],\quad \text{BlockTrace 取对角线得 } [b_0, M, N]

交叉项被算出但丢弃(冗余比例 (b₀1)/b₀——冗余算力换搬移效率,进入条件 5 保证 case 为访存 Bound冗余被搬移时延掩盖。

2. 进入条件5 条同时满足)

# 条件 物理含义
1 BatchA = BatchB 且 b_core = B/C ≥ 2b₀ (≥4) 无广播才能逐 batch 对应合并;每核至少 2 组构成合并组间乒乓
2 2·(b₀M)(b₀N)·4B ≤ L0C (256KB) 合并后输出放得下 L0C 双缓冲;连最小合并都放不下则无从谈起
3 b_core·(MK+KN)·dtype ≥ 480KB 单核搬移总量足够GM 带宽利用率才上得去
4 max(MK, KN)·dtype ≥ 16KB 单 batch 单矩阵最大连续搬移块达到 min_TileSize
5 2MN/(M+N) < R₁₆/b₀ 合并放大算存比 b₀ 倍后仍访存 Bound瓶颈留在搬移侧

3. 实现方案4 步)

Step 1: 合并数 b₀L0C + 算存比双上限,尽量取 b_core 的因子)

b_0 = \min\Big(\sqrt{\frac{L0C}{2\cdot MN\cdot 4B}},\; \frac{R_{16}(M+N)}{2MN},\; b_{core}\Big)

Step 2: L0 级 K 粒度 k_L0 = min(L0A/(2·b₀M·dt), L0B/(2·b₀N·dt)) 向下 16 对齐

Step 3: L1 级 k_L1(先反推再截断)

k_{L1}^* = \frac{L1}{2\cdot b_0\cdot(M+N)\cdot dt},\qquad k_{L1} = \min(k_{L1}^*,\; K,\; 512B/dt)

不超过 KK 截断),不超过 dValue 推荐值 512B更大无额外收益

Step 4: b_L1 最大化

b_{L1} = \min\Big(\frac{L1}{2\cdot k_{L1}\cdot(M+N)\cdot dt},\; b_{core}\Big) \ge b_0

k_L1 被 512B 截断省出的 L1 空间容纳更多 batch提升 batch 间流水深度。

4. 时延模型v1.1 §4

符号T_load = k_L1(M+N)·dt/BW_pc每 K 分块搬移、T_comp = 2MN·k_L1/Q₁₆每 K 分块计算、T_write = MN·outB/W_GM单 batch 写回、T_cmd单次 GM→L1 DMA 固定开销,~50ns

T_{mb} = \underbrace{\frac{b_{core}}{b_0}\cdot n_K^m\cdot(T_{load}^m + T_{cmd})}_{\text{搬移(合并)}} + \underbrace{b_0(T_{comp}+T_{write})}_{\text{末合并 batch drain}}

两种情形:

情形 k_L1^m n_K^m 搬移命令数 结论
K 截断 (k_L1=K) K 不减半 1 b_core/b₀少 b₀ 倍) MergeBatch 可胜
L1 绑定 (k_L1<K) k_L1/b₀ b₀·n_K b_core·n_K与 IterBatch 相同) MergeBatch 恒劣

L1 绑定情形搬移次数、单次搬移量都与 IterBatch 相同,只放大 drain——证明见 v1.1 §4.4。

GM 数据量口径 (issue#31): 各 (合并组, K段) 的数据互不重叠, 每个输入字节恰好从 GM 读一次 —— K 截断与 L1 绑定两种情形的芯片 GM 读取量都 = V_in (末段按实际剩余计, 无 padding 上取)。上式的 T_load 级联只用于刻画命令/双缓冲调度结构: 数据时延按 V_in/W_GM 计, n_K 只放大 DMA 命令项 (b_core/b₀ 或 b_core·n_K) × T_cmd。

5. MergeBatch vs IterBatch 净收益

\text{净收益} = \underbrace{b_{core}\Big(1-\frac{1}{b_0}\Big)T_{cmd}}_{\text{搬移命令节省}} - \underbrace{(b_0-1)(T_{comp}+T_{write})}_{\text{drain 惩罚}}

大 Bb_core 大)且小 MNT_comp 小)时 MergeBatch 最优。T_cmd 的物理成因Nd2Nz 描述符配置7 字段写 DMA 寄存器)+ 地址生成 + 突发启动 + L1 同步握手。

6. 与源码的差异v1.1 §5.1

源码 MergeBatch 进入条件偏宽——缺搬移量/tile 大小/算存比三条约束,可能把计算 Bound 的 case 误捕获(冗余计算成为新瓶颈)。本软件以理论 5 条件为准。