Files
matmul-analysis/BMM/BMM_Theory/docs/02_分支理论/02_IterBatch分支.md
admin b0b48b9073 Fix #36: MergeBatch 合并搬移效率收益建模 (move_eff) + t_cmd_ns 置 0
用户澄清: MergeBatch vs IterBatch 的本质区别不只是 DMA 命令数 —— 合并 b0 个
batch 的左/右矩阵一起搬入 L1, 使单块 tile = nValue*dValue*dt 放大 b0 倍 (堆叠
方向视转置: A ND 非转置沿 M(nValue), B ND 非转置沿 N(dValue)), 搬移效率更高,
即便 T_cmd=0 也有效益。

- models.move_eff: 单命令搬移效率 eff = min(1, tile/min_TileSize) (16KB 饱和,
  与进入条件4效率下限语义同源); gm_move_time 按 A/B 两侧字节加权
  t = (V_A/eff_A + V_B/eff_B)/BW_gm; 只影响时间列, GM 字节量仍 = V_in
- IterBatch: l1_form 补驻留侧返回; move_tiles 分侧口径 (a/b 双侧整K, c 驻留侧
  整K+对侧k_l1, d 双侧k_l1), evaluate 接入效率加权
- MergeBatch: 合并 tile 放大 b0 倍接入效率加权; beats_iterbatch 净收益 =
  命令节省(cmds差×T_cmd) + 效率节省(t_data差) − drain惩罚, K截断且效率打平且
  T_cmd>0 时严格退化为 v1.1 §4.5 闭式; 退役 T_cmd<=0 策略特判
- router: 退役 "T_cmd<=0 策略优先 MergeBatch" 覆盖, 时延模型统一终审
- hardware: t_cmd_ns 50 -> 0 (未标定按 0; 合并收益不再依赖 T_cmd 估计值)
- 作用域: 仅切B 两分支接入 (逐命令 tile 小、效率差显著); ASW/StreamK 单命令
  tile 通常已饱和, 极端小 tile 走 issue#34 效率降级标注通道
- 用户 case 家族 B=128,M=1~16,N=128,K=512: m=1~8 -> MergeBatch (效率节省
  ~0.61us > drain), m=16 -> IterBatch (iter A tile 恰达 16KB 饱和, 效率打平,
  drain 决定); 分界与时延全家族一致
- demo: merge_demo_k_trunc 形状 (2048,32,32,256)->(2048,16,64,128) (原形状
  两侧 tile 均已 16KB 饱和, t_cmd=0 下无收益转 IterBatch; 新形状 iter A tile
  4KB eff=0.25 vs 合并 16KB eff=1.0, 保持 MergeBatch 胜出演示且仍 K截断)
- 测试: 74/74 (新增 TestIssue36 5 例: 效率曲线/字节不变/效率差胜出/家族;
  TestArbitration/TestZeroCmdHandling 按 t_cmd=0+效率语义重写; TestIssue35
  家族期望更新)
- 文档: 01_MergeBatch §4/§5 效率模型+泛化净收益; 02_IterBatch 口径注;
  00_总纲胜出条件; 01_软件架构 T_cmd 标定说明; 05 时间列效率口径注; README 要点
- 验证: examples 重生成可复现 0 diff; 压力 10000 例 0 崩溃/0 NaN/0 违规/
  0 GM<V_in, 七分支覆盖 (MergeBatch 386 例)
2026-09-07 21:09:49 +08:00

4.2 KiB
Raw Blame History

IterBatch 分支理论

整理自《BMM算子优化分析 v0.98》§六 + 《MergeBatch_vs_IterBatch分析 v1.1》§二. 对应软件实现: bmm_theory/branches/iter_batch.py.

1. 一句话本质

核间切 B每核 b_core ≥ 1 个 batch核内逐个 batch 做标准 Matmul 分块计算——无算力浪费、无跨 batch 依赖,是"切 B"最朴素的形态。

2. 进入条件4 条同时满足)

# 条件 说明
1 BatchA = BatchB 且 b_core ≥ 1 无广播;每核至少 1 个 batch
2 B mod C = 0 或 B mod C ≥ minCoreNum (≈26) 负载均衡:不整除时尾波活跃核数须够,保证尾波仍有足够核并发搬移
3 L1 驻留形态四选一 核心要求:单 batch 计算核内零重复读
4 切分后搬移分块 ≥ 16KB 且 dValue ≥ 128B 守住搬移效率下限

3. L1 驻留四形态

形态 条件 特征
a) 单 batch 全驻留 b_core=1(MK+KN)·dt ≤ L1 零重复读
b) 双 batch 乒乓 b_core>12(MK+KN)·dt ≤ L1 batch 间流水掩盖命中最多70%
c) 一侧驻留 + 对侧切 K 驻留侧 ≤ L1_budgetL1_budget = L1/min(b_core,2) 驻留侧零重复读b_core≥2 时另一半 L1 预取下一 batch 驻留侧,边界无气泡
d) 两侧都切 K 兜底 两侧 K 段级重复读K 段成对流水batch 边界天然无缝

为什么直接进入条件而不是算存比:即使 case 是计算 Bound重复读引入的额外搬移也可能把它拖回访存 Bound——所以由 L1 驻留形态刻画,而不是由 AI 判定。

4. 实现方案

  • L0 tileL0C 放得下完整单 batch 输出M·N·4B·2 ≤ L0C则 BaseM=M、BaseN=N 只切 K放不下则按较小维切。BaseK = min(L0A/(2·BaseM·dt), L0B/(2·BaseN·dt)) 向下 16 对齐;
  • L1 tilek_L1 按形态确定,须满足 k_L1·dt ≥ 128BdValue 下限);
  • 流水fixpipe 开 unitflag每个 16×16×16 fractal 算完即自动搬出写出侧不需要软件排流水batch 间由 L0C 双缓冲自动交叠;
  • batch 边界掩盖:要掩盖的只有"读入 (MTE2) ↔ 计算 (Cube)"。c 形态 b_core≥2 时半预算预取驻留侧d 形态 K 段槽位同质连续天然无缝。

5. 时延模型v1.1 §4IterBatch 侧)

T_{iter} = \underbrace{b_{core}\cdot n_K\cdot(T_{load} + T_{cmd})}_{\text{搬移(逐 batch, 每次含 }T_{cmd}\text{)}} + \underbrace{T_{comp} + T_{write}}_{\text{末 batch drain}}

每 batch 的 A[M,K]+B[K,N] 作为独立 DMA 操作搬入 L1源码 ndNum = curIterBatchL1,多块独立寻址)。

GM 数据量口径 (issue#31): 形态 a/b/c/d 的 K 段/驻留侧数据互不重叠、每个输入字节 恰好从 GM 读一次 (形态 c 的驻留侧每 batch 只搬一次; 切 K 末段按实际剩余计, 无 padding 上取) —— 芯片 GM 读取量 = V_in, 与 L2 容量无关 (IterBatch 无 L2 级重复读)。 n_K 只决定 DMA 命令数 (T_cmd 项, 950PR 默认 t_cmd=0) 与双缓冲调度, 不放大数据量; 数据时延按效率加权 (V_A/eff_A + V_B/eff_B)/W_GM 计 (issue#36: 单命令 tile = nValue×dValue×dt 越小有效带宽越低, 达 min_TileSize=16KB 饱和; 分侧口径 —— a/b 形态 双侧整 K、c 形态驻留侧整 K + 对侧 k_L1 分块、d 形态双侧 k_L1 分块)。

6. 与 MergeBatch 的分界

01_MergeBatch分支.md §4~5。IterBatch 在 L1 绑定理想情形恒优MergeBatch 凭 命令节省 (T_cmd>0 时) 与 搬移效率节省 (合并 tile 放大 b0 倍, T_cmd=0 时仍成立, issue#36) 胜出 —— 净收益 > 0 即 MergeBatch 优。

7. 与源码的差异v1.1 §5.2

源码 IterBatch 只覆盖形态 b双 batch 乒乓)且要求 B > C形态 a/c/d 的 case 由其他分支承接。本软件按理论完整覆盖四形态。

8. L0C 放不下 2 batch 时的 fallbackv1.1 §5.3

源码在 L0C < 2·MN·4B 时不直接拒绝而是查 balance rate ≥ 0.8。理论证明该 fallback 自洽:此时 K < 362 → 写出 Bound 或接近均衡 → L0C 串行损失有界≤54% 且随 K 减小而减小)→ 真正风险在 batch 负载不均(尾轮拖长)→ 软门限防负载不均是合理设计。