From 6808d5d7fc5a22c253c860737ffeebeadcf3f754 Mon Sep 17 00:00:00 2001 From: admin Date: Thu, 3 Sep 2026 08:10:33 +0000 Subject: [PATCH] =?UTF-8?q?Add=20BMM=5FTheory:=20docs/02=5F=E5=88=86?= =?UTF-8?q?=E6=94=AF=E7=90=86=E8=AE=BA/02=5FIterBatch=E5=88=86=E6=94=AF.md?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- .../docs/02_分支理论/02_IterBatch分支.md | 53 +++++++++++++++++++ 1 file changed, 53 insertions(+) create mode 100644 BMM/BMM_Theory/docs/02_分支理论/02_IterBatch分支.md diff --git a/BMM/BMM_Theory/docs/02_分支理论/02_IterBatch分支.md b/BMM/BMM_Theory/docs/02_分支理论/02_IterBatch分支.md new file mode 100644 index 0000000..3a49d59 --- /dev/null +++ b/BMM/BMM_Theory/docs/02_分支理论/02_IterBatch分支.md @@ -0,0 +1,53 @@ +# IterBatch 分支理论 + +> 整理自《BMM算子优化分析 v0.98》§六 + 《MergeBatch_vs_IterBatch分析 v1.1》§二. +> 对应软件实现: `bmm_theory/branches/iter_batch.py`. + +## 1. 一句话本质 + +核间切 B(每核 b_core ≥ 1 个 batch),核内**逐个 batch 做标准 Matmul 分块计算**——无算力浪费、无跨 batch 依赖,是"切 B"最朴素的形态。 + +## 2. 进入条件(4 条同时满足) + +| # | 条件 | 说明 | +|---|---|---| +| 1 | BatchA = BatchB 且 b_core ≥ 1 | 无广播;每核至少 1 个 batch | +| 2 | B mod C = 0 或 B mod C ≥ minCoreNum (≈26) | 负载均衡:不整除时尾波活跃核数须够,保证尾波仍有足够核并发搬移 | +| 3 | L1 驻留形态四选一 | **核心要求:单 batch 计算核内零重复读** | +| 4 | 切分后搬移分块 ≥ 16KB 且 dValue ≥ 128B | 守住搬移效率下限 | + +## 3. L1 驻留四形态 + +| 形态 | 条件 | 特征 | +|---|---|---| +| **a) 单 batch 全驻留** | b_core=1,(MK+KN)·dt ≤ L1 | 零重复读 | +| **b) 双 batch 乒乓** | b_core>1,2(MK+KN)·dt ≤ L1 | batch 间流水掩盖(命中最多,70%) | +| **c) 一侧驻留 + 对侧切 K** | 驻留侧 ≤ L1_budget,L1_budget = L1/min(b_core,2) | 驻留侧零重复读;b_core≥2 时另一半 L1 预取下一 batch 驻留侧,边界无气泡 | +| **d) 两侧都切 K** | 兜底 | 两侧 K 段级重复读;K 段成对流水,batch 边界天然无缝 | + +**为什么直接进入条件而不是算存比**:即使 case 是计算 Bound,重复读引入的额外搬移也可能把它拖回访存 Bound——所以由 L1 驻留形态刻画,而不是由 AI 判定。 + +## 4. 实现方案 + +- **L0 tile**:L0C 放得下完整单 batch 输出(M·N·4B·2 ≤ L0C)则 BaseM=M、BaseN=N 只切 K;放不下则按较小维切。BaseK = min(L0A/(2·BaseM·dt), L0B/(2·BaseN·dt)) 向下 16 对齐; +- **L1 tile**:k_L1 按形态确定,须满足 k_L1·dt ≥ 128B(dValue 下限); +- **流水**:fixpipe 开 unitflag(每个 16×16×16 fractal 算完即自动搬出,写出侧不需要软件排流水);batch 间由 L0C 双缓冲自动交叠; +- **batch 边界掩盖**:要掩盖的只有"读入 (MTE2) ↔ 计算 (Cube)"。c 形态 b_core≥2 时半预算预取驻留侧;d 形态 K 段槽位同质连续天然无缝。 + +## 5. 时延模型(v1.1 §4,IterBatch 侧) + +$$T_{iter} = \underbrace{b_{core}\cdot n_K\cdot(T_{load} + T_{cmd})}_{\text{搬移(逐 batch, 每次含 }T_{cmd}\text{)}} + \underbrace{T_{comp} + T_{write}}_{\text{末 batch drain}}$$ + +每 batch 的 A[M,K]+B[K,N] 作为独立 DMA 操作搬入 L1(源码 `ndNum = curIterBatchL1`,多块独立寻址)。 + +## 6. 与 MergeBatch 的分界 + +见 [01_MergeBatch分支.md](01_MergeBatch分支.md) §4~5。IterBatch 在 **L1 绑定情形恒优**;MergeBatch 仅在 K 截断且 b_core 足够大时胜。 + +## 7. 与源码的差异(v1.1 §5.2) + +源码 IterBatch 只覆盖形态 b(双 batch 乒乓)且要求 B > C;形态 a/c/d 的 case 由其他分支承接。本软件按理论完整覆盖四形态。 + +## 8. L0C 放不下 2 batch 时的 fallback(v1.1 §5.3) + +源码在 L0C < 2·MN·4B 时不直接拒绝而是查 balance rate ≥ 0.8。理论证明该 fallback 自洽:此时 K < 362 → 写出 Bound 或接近均衡 → L0C 串行损失有界(≤54% 且随 K 减小而减小)→ 真正风险在 batch 负载不均(尾轮拖长)→ 软门限防负载不均是合理设计。