Fix #33: ASW_Basic tile 选择重写 (v1.91 §5.1/§5.2 + 尾轮 v1.5 §2.1)

- BaseM/BaseN: UnitFlag 单缓冲方形 256x256 (L0C/4B=65536 元素用满, 替代双缓冲 176x176);
  M/N < 256 被迫跟随 M/N (另一侧按 L0C 余量放大, 且收敛 L0A/L0B baseK>=16 单边上限);
  baseK = min(L0A/(2*BaseM*dt), L0B/(2*BaseN*dt)) 向下16对齐 (64KB 两侧双缓冲)
- SingleCoreM/N: 有界枚举取代旧"仅 sqrt(P)+2 范围按面积取最大"(恒退回176兜底):
  P=1 (B>=C) 先试不切分 tile 跟随 M/N; 否则枚举 mCnt<=ceil(M/BaseM) x nCnt<=ceil(N/BaseN)
  且 B*mCnt*nCnt>=C, sM/sN 为 Base 整数倍, 约束2 L1 双缓冲反推 k_L1,
  约束3 dValue>=256B 转置感知 + minTile 16KB; 目标 = 每batch搬入 K*dt*(nCnt*M+mCnt*N) 最小
  (v1.5 修正: 稳态下 k_L1 约掉, 只进约束); 并列取 r 最大
- 兜底: 约束4无解时放开到 16 对齐网格按硬下限(dValue>=128B)再搜; 极端形状
  (如 N=8 int8 大K)仍无解时退回 Base tile 并自检标注违规 (不静默产伪方案)
- constraints: ASW 双分支 L0C 口径改 UnitFlag 单缓冲 (factor 1)
- docs/06 Step0/Step1/Step6 重写为 v1.91 口径, 头部标注 2026-09 更新与 issue#33
- 回归: v1.91 §5.2 完整实例 (B=8 M=N=2048 K=1024 -> (4,4) 512x512, k_l1=128, r=0);
  方形例外 (M=128 -> 128x512); 单缓冲约束通过; 极端形状违规标注; 60->61 测试全过;
  压力 seed7/6000 + seed2024/4000: 0 崩溃/0 NaN/0 GM<V_in, 违规仅剩极端形状如实标注;
  examples 重生成可复现 0 diff (L2 重复读降 2-3x, 如 b128_m8192_n8192_k7168 1.38TB->451GB)
This commit is contained in:
2026-09-07 15:49:24 +08:00
parent 18f59599e7
commit 05ca91e291
7 changed files with 321 additions and 123 deletions

View File

@@ -1,8 +1,9 @@
# ASW_Basic 分支理论(含尾轮处理)
> 整理自《BMM算子优化分析 v0.98》§八 + 《BMM尾轮处理策略对比分析 v1.5》.
> 整理自《BMM算子优化分析 v0.98》§八 + 《ASW_Basic分支分析 v1.91》 + 《BMM尾轮处理策略对比分析 v1.5》.
> 尾轮策略的完整推导见 [07_尾轮处理策略.md](07_尾轮处理策略.md), 本文将其结论**内化为 ASW_Basic 最优实现的必要环节**.
> 对应软件实现: `bmm_theory/branches/asw_basic.py`.
> 2026-09 更新: Step0/Step1 按 v1.91 §5.1/§5.2 重写为"UnitFlag 单缓冲方形 256 + 有界枚举最小搬入" (issue#33)。
## 1. 定位:兜底分支,实践中最常命中
@@ -56,22 +57,41 @@ GM = V_in 一次r_in=1共享块重复读全部命中 L2S_C 双侧均
## 5. 实现方案
**Step 0: BaseM/BaseN**L0 级 tile,先把 L0C 用满
**Step 0: BaseM/BaseN**L0 级 tile, 先按 UnitFlag 单缓冲把 L0C 用满——v1.91 §5.1
$$\text{BaseM}\times\text{BaseN} = \frac{L0C}{2\times 4B} = 32768\ \text{元素}$$
Fixpipe 的 UnitFlag 提供 **tile 内部 16×16×16 细粒度流水**, 取代 tile 间粗粒度双缓冲 →
L0C 只需一份 buffer:
双缓冲两份、FP32 4B/元素。长宽比跟随 SingleCoreM/N对齐 16。baseK = min(L0A/(2·BaseM·dt), L0B/(2·BaseN·dt)) 向下 16 对齐L1→L0 无 dValue 要求)。
$$\text{BaseM}\times\text{BaseN} = \frac{L0C}{4\text{B}} = 65536\ \text{元素UnitFlag 单缓冲)}$$
**Step 1: SingleCoreM/N**(每核输出 tile≥ BaseM/N
长宽比**方形优先**(而非跟随 M/N——跟随不会改善 GM→L1 搬移, 只会使 L0A/L0B 容量利用率
失衡、baseK 减半): 默认 BaseM = BaseN = 256L0A/L0B 同时装满); **例外**: M 或 N 小于
方形边长时被迫跟随: BaseM = min(256, ⌊M⌋₁₆), 另一维 = min(65536/BaseM, N) 向下 16 对齐
M=128, N=4096 → BaseM=128, BaseN=512
不受 L0 容量直接约束(内部由若干 BaseM×BaseN L0 tile 组成)。核心影响 **GM→L1 搬移效率和 L2 重复读率**
$$\text{baseK} = \min\Big(\frac{L0A}{2 \cdot \text{BaseM} \cdot dtype},\; \frac{L0B}{2 \cdot \text{BaseN} \cdot dtype}\Big) \text{ 向下 16 对齐}$$
- 约束 1 并行度:`mCnt×nCnt ≥ ⌈C/B⌉`
- 约束 2 L1 容量:`2(sM+sN)·k_L1·dt ≤ L1``k_L1·dt ≥ 256B`
- 约束 3 搬移效率:`sM·k_L1·dt ≥ 16KB``k_L1·sN·dt ≥ 16KB`
- 约束 4SingleCoreM/N 是 BaseM/N 的整数倍。
L0A/L0B 仍开双缓冲; 16 对齐是 Cube K 向粒度要求, L1→L0 搬移无 dValue 要求。)
选取策略:满足约束 1 前提下 SingleCoreM/N 尽量大,长宽比跟随 M/N。
**Step 1: SingleCoreM/N + k_L1 + mCnt/nCnt**有界枚举——v1.91 §5.2, 与尾轮 v1.5 §2.1
修正口径一致)
SingleCoreM/N **不受 L0 容量直接约束**(内部由若干 BaseM×BaseN L0 tile 组成), 核心影响
GM→L1 搬移效率与 L2 重复读率:
- **P = ⌈C/B⌉**(最少切分块数);
- **P=1 (B ≥ C)**: 先试不切分 (mCnt=nCnt=1, tile 跟随 M/N); 约束不满足则强制切分, 进入枚举;
- **枚举空间**(有界, host 端遍历): mCnt ∈ [1, ⌈M/BaseM⌉], nCnt ∈ [1, ⌈N/BaseN⌉],
且 B·mCnt·nCnt ≥ C约束 1 并行度);
- 每候选: sM = align_up(⌈M/mCnt⌉, BaseM)(约束 4: BaseM 整数倍), sN 同理;
- **约束 2**L1 双缓冲): k_L1 = min(K, ⌊L1/(2(sM+sN)·dtype)⌋₁₆)k_L1 与形状耦合);
- **约束 3**(搬移效率, 转置感知): dValue ≥ 256B——A 非转置 k_L1·dt / A 转置 sM·dt;
B 非转置 sN·dt / B 转置 k_L1·dt; 且单次搬移量 sM·k_L1·dt 与 k_L1·sN·dt ≥ 16KB;
- **目标**: 每 batch 总搬入 `K·dt·(nCnt·M + mCnt·N)` 最小v1.5 §2.1 修正: 稳态流水下
k_L1 约掉——单块搬入 = K(sM+sN)·dt 与分次粒度无关, k_L1 只进约束);
**并列时取 r = B·mCnt·nCnt mod C 最大**(尾轮块越多, 重切越省)。
mCnt = ⌈M/singleCoreM⌉, nCnt = ⌈N/singleCoreN⌉按实际 tile 反推)。
**Step 2: mCnt/nCnt 与核间分配**`mCnt=⌈M/sM⌉``nCnt=⌈N/sN⌉`,总块数 B·mCnt·nCntB→M→N 线性映射。
@@ -95,7 +115,7 @@ A 行块 block_a = a_b/m_cnt、B 列块 block_b = b_b/n_cnt。
> 注:早期口径(预算 D = L2/(B·K·dt) 且对半切、组内窗口流量零计)已废弃
> issue#24 除总 B 的矛盾、issue#32 对半预算与窗口零计失真);分组不再对半、窗口复用如实计 L2。
**Step 6: 核内 tiling**BaseM×BaseN×4B×DB ≤ L0CBaseM×k_L0×dt×2 ≤ L0Ak_L0×BaseN×dt×2 ≤ L0B内轴按 dValue 256B/512B 对齐。
**Step 6: 核内 tiling**BaseM×BaseN×4B ≤ L0CUnitFlag 单缓冲, 见 Step 0BaseM×k_L0×dt×2 ≤ L0Ak_L0×BaseN×dt×2 ≤ L0B内轴按 dValue 256B/512B 对齐。
**Step 7: 内部特化**:单边无 batch 且该侧矩阵小时小侧整个常驻 L1 只搬一次。