#31 IterBatch/MergeBatch: K切分各(batch,K段)互不重叠+驻留侧每batch一次+末段按实际剩余 -> GM读取量=V_in(与L2容量无关), GM数据时延=V_in/W_GM; n_K仅决定DMA命令数(T_cmd) b64_m16_n256_k512 形态c: GM 25.07MB->17.83MB=V_in; 回归: 形态c/d非整除+L1绑定三类断言 #32 ASW: (1)S_B扩展单侧全驻留+对侧滑窗(a_b/b_b+2*对侧单块<=L2) -> GM=V_in, 6个场景C行回落S_B; (2)S_C在整L2容量约束下搜索最小GM=ceil(n_cnt/n_grp)a_b+ceil(m_cnt/m_grp)b_b(取代L2/2对半预算), 并计组内窗口L2流量((n_cnt-ceil)a_b+(m_cnt-ceil)b_b), 与S_B'驻留命中走L2'口径一致; b8_m131072_n8192_k8192 GM倍率4.76x->3.88x(物理下界~3.9x, 双侧均超L2) 大方形K行(如b128_m8192_n8192_k7168)由MMAD 253ms->MTE2(L2口)295ms: 共享块重复读1.38TB 经L2读口5.2TB/s, 如实计账(原C窗口流量零计低估) - docs/06 §3与Step5重写为S_A/S_B/S_C+两段链口径(旧r_in单段/除B/对半预算口径废弃) - docs/05 R5/R6/§3.1/§4.1/§4.3/§5与docs/01、02(01_MergeBatch/02_IterBatch GM口径附注)同步 - tests 54/54; 压力seed7/6000+seed2024/4000: 0违规/0占位/0NaN/0GM<V_in; examples重生成0diff
3.8 KiB
IterBatch 分支理论
整理自《BMM算子优化分析 v0.98》§六 + 《MergeBatch_vs_IterBatch分析 v1.1》§二. 对应软件实现:
bmm_theory/branches/iter_batch.py.
1. 一句话本质
核间切 B(每核 b_core ≥ 1 个 batch),核内逐个 batch 做标准 Matmul 分块计算——无算力浪费、无跨 batch 依赖,是"切 B"最朴素的形态。
2. 进入条件(4 条同时满足)
| # | 条件 | 说明 |
|---|---|---|
| 1 | BatchA = BatchB 且 b_core ≥ 1 | 无广播;每核至少 1 个 batch |
| 2 | B mod C = 0 或 B mod C ≥ minCoreNum (≈26) | 负载均衡:不整除时尾波活跃核数须够,保证尾波仍有足够核并发搬移 |
| 3 | L1 驻留形态四选一 | 核心要求:单 batch 计算核内零重复读 |
| 4 | 切分后搬移分块 ≥ 16KB 且 dValue ≥ 128B | 守住搬移效率下限 |
3. L1 驻留四形态
| 形态 | 条件 | 特征 |
|---|---|---|
| a) 单 batch 全驻留 | b_core=1,(MK+KN)·dt ≤ L1 | 零重复读 |
| b) 双 batch 乒乓 | b_core>1,2(MK+KN)·dt ≤ L1 | batch 间流水掩盖(命中最多,70%) |
| c) 一侧驻留 + 对侧切 K | 驻留侧 ≤ L1_budget,L1_budget = L1/min(b_core,2) | 驻留侧零重复读;b_core≥2 时另一半 L1 预取下一 batch 驻留侧,边界无气泡 |
| d) 两侧都切 K | 兜底 | 两侧 K 段级重复读;K 段成对流水,batch 边界天然无缝 |
为什么直接进入条件而不是算存比:即使 case 是计算 Bound,重复读引入的额外搬移也可能把它拖回访存 Bound——所以由 L1 驻留形态刻画,而不是由 AI 判定。
4. 实现方案
- L0 tile:L0C 放得下完整单 batch 输出(M·N·4B·2 ≤ L0C)则 BaseM=M、BaseN=N 只切 K;放不下则按较小维切。BaseK = min(L0A/(2·BaseM·dt), L0B/(2·BaseN·dt)) 向下 16 对齐;
- L1 tile:k_L1 按形态确定,须满足 k_L1·dt ≥ 128B(dValue 下限);
- 流水:fixpipe 开 unitflag(每个 16×16×16 fractal 算完即自动搬出,写出侧不需要软件排流水);batch 间由 L0C 双缓冲自动交叠;
- batch 边界掩盖:要掩盖的只有"读入 (MTE2) ↔ 计算 (Cube)"。c 形态 b_core≥2 时半预算预取驻留侧;d 形态 K 段槽位同质连续天然无缝。
5. 时延模型(v1.1 §4,IterBatch 侧)
T_{iter} = \underbrace{b_{core}\cdot n_K\cdot(T_{load} + T_{cmd})}_{\text{搬移(逐 batch, 每次含 }T_{cmd}\text{)}} + \underbrace{T_{comp} + T_{write}}_{\text{末 batch drain}}
每 batch 的 A[M,K]+B[K,N] 作为独立 DMA 操作搬入 L1(源码 ndNum = curIterBatchL1,多块独立寻址)。
GM 数据量口径 (issue#31): 形态 a/b/c/d 的 K 段/驻留侧数据互不重叠、每个输入字节 恰好从 GM 读一次 (形态 c 的驻留侧每 batch 只搬一次; 切 K 末段按实际剩余计, 无 padding 上取) —— 芯片 GM 读取量 = V_in, 与 L2 容量无关 (IterBatch 无 L2 级重复读)。 n_K 只决定 DMA 命令数 (T_cmd 项) 与双缓冲调度, 不放大数据量; 数据时延按 V_in/W_GM 计。
6. 与 MergeBatch 的分界
见 01_MergeBatch分支.md §4~5。IterBatch 在 L1 绑定情形恒优;MergeBatch 仅在 K 截断且 b_core 足够大时胜。
7. 与源码的差异(v1.1 §5.2)
源码 IterBatch 只覆盖形态 b(双 batch 乒乓)且要求 B > C;形态 a/c/d 的 case 由其他分支承接。本软件按理论完整覆盖四形态。
8. L0C 放不下 2 batch 时的 fallback(v1.1 §5.3)
源码在 L0C < 2·MN·4B 时不直接拒绝而是查 balance rate ≥ 0.8。理论证明该 fallback 自洽:此时 K < 362 → 写出 Bound 或接近均衡 → L0C 串行损失有界(≤54% 且随 K 减小而减小)→ 真正风险在 batch 负载不均(尾轮拖长)→ 软门限防负载不均是合理设计。