Fix #33: ASW_Basic tile 选择重写 (v1.91 §5.1/§5.2 + 尾轮 v1.5 §2.1)
- BaseM/BaseN: UnitFlag 单缓冲方形 256x256 (L0C/4B=65536 元素用满, 替代双缓冲 176x176); M/N < 256 被迫跟随 M/N (另一侧按 L0C 余量放大, 且收敛 L0A/L0B baseK>=16 单边上限); baseK = min(L0A/(2*BaseM*dt), L0B/(2*BaseN*dt)) 向下16对齐 (64KB 两侧双缓冲) - SingleCoreM/N: 有界枚举取代旧"仅 sqrt(P)+2 范围按面积取最大"(恒退回176兜底): P=1 (B>=C) 先试不切分 tile 跟随 M/N; 否则枚举 mCnt<=ceil(M/BaseM) x nCnt<=ceil(N/BaseN) 且 B*mCnt*nCnt>=C, sM/sN 为 Base 整数倍, 约束2 L1 双缓冲反推 k_L1, 约束3 dValue>=256B 转置感知 + minTile 16KB; 目标 = 每batch搬入 K*dt*(nCnt*M+mCnt*N) 最小 (v1.5 修正: 稳态下 k_L1 约掉, 只进约束); 并列取 r 最大 - 兜底: 约束4无解时放开到 16 对齐网格按硬下限(dValue>=128B)再搜; 极端形状 (如 N=8 int8 大K)仍无解时退回 Base tile 并自检标注违规 (不静默产伪方案) - constraints: ASW 双分支 L0C 口径改 UnitFlag 单缓冲 (factor 1) - docs/06 Step0/Step1/Step6 重写为 v1.91 口径, 头部标注 2026-09 更新与 issue#33 - 回归: v1.91 §5.2 完整实例 (B=8 M=N=2048 K=1024 -> (4,4) 512x512, k_l1=128, r=0); 方形例外 (M=128 -> 128x512); 单缓冲约束通过; 极端形状违规标注; 60->61 测试全过; 压力 seed7/6000 + seed2024/4000: 0 崩溃/0 NaN/0 GM<V_in, 违规仅剩极端形状如实标注; examples 重生成可复现 0 diff (L2 重复读降 2-3x, 如 b128_m8192_n8192_k7168 1.38TB->451GB)
This commit is contained in:
@@ -1,8 +1,9 @@
|
||||
# ASW_Basic 分支理论(含尾轮处理)
|
||||
|
||||
> 整理自《BMM算子优化分析 v0.98》§八 + 《BMM尾轮处理策略对比分析 v1.5》.
|
||||
> 整理自《BMM算子优化分析 v0.98》§八 + 《ASW_Basic分支分析 v1.91》 + 《BMM尾轮处理策略对比分析 v1.5》.
|
||||
> 尾轮策略的完整推导见 [07_尾轮处理策略.md](07_尾轮处理策略.md), 本文将其结论**内化为 ASW_Basic 最优实现的必要环节**.
|
||||
> 对应软件实现: `bmm_theory/branches/asw_basic.py`.
|
||||
> 2026-09 更新: Step0/Step1 按 v1.91 §5.1/§5.2 重写为"UnitFlag 单缓冲方形 256 + 有界枚举最小搬入" (issue#33)。
|
||||
|
||||
## 1. 定位:兜底分支,实践中最常命中
|
||||
|
||||
@@ -56,22 +57,41 @@ GM = V_in 一次(r_in=1),共享块重复读全部命中 L2;S_C 双侧均
|
||||
|
||||
## 5. 实现方案
|
||||
|
||||
**Step 0: BaseM/BaseN**(L0 级 tile,先把 L0C 用满)
|
||||
**Step 0: BaseM/BaseN**(L0 级 tile, 先按 UnitFlag 单缓冲把 L0C 用满——v1.91 §5.1)
|
||||
|
||||
$$\text{BaseM}\times\text{BaseN} = \frac{L0C}{2\times 4B} = 32768\ \text{元素}$$
|
||||
Fixpipe 的 UnitFlag 提供 **tile 内部 16×16×16 细粒度流水**, 取代 tile 间粗粒度双缓冲 →
|
||||
L0C 只需一份 buffer:
|
||||
|
||||
双缓冲两份、FP32 4B/元素。长宽比跟随 SingleCoreM/N,对齐 16。baseK = min(L0A/(2·BaseM·dt), L0B/(2·BaseN·dt)) 向下 16 对齐(L1→L0 无 dValue 要求)。
|
||||
$$\text{BaseM}\times\text{BaseN} = \frac{L0C}{4\text{B}} = 65536\ \text{元素(UnitFlag 单缓冲)}$$
|
||||
|
||||
**Step 1: SingleCoreM/N**(每核输出 tile,≥ BaseM/N)
|
||||
长宽比**方形优先**(而非跟随 M/N——跟随不会改善 GM→L1 搬移, 只会使 L0A/L0B 容量利用率
|
||||
失衡、baseK 减半): 默认 BaseM = BaseN = 256(L0A/L0B 同时装满); **例外**: M 或 N 小于
|
||||
方形边长时被迫跟随: BaseM = min(256, ⌊M⌋₁₆), 另一维 = min(65536/BaseM, N) 向下 16 对齐
|
||||
(例:M=128, N=4096 → BaseM=128, BaseN=512)。
|
||||
|
||||
不受 L0 容量直接约束(内部由若干 BaseM×BaseN L0 tile 组成)。核心影响 **GM→L1 搬移效率和 L2 重复读率**:
|
||||
$$\text{baseK} = \min\Big(\frac{L0A}{2 \cdot \text{BaseM} \cdot dtype},\; \frac{L0B}{2 \cdot \text{BaseN} \cdot dtype}\Big) \text{ 向下 16 对齐}$$
|
||||
|
||||
- 约束 1 并行度:`mCnt×nCnt ≥ ⌈C/B⌉`;
|
||||
- 约束 2 L1 容量:`2(sM+sN)·k_L1·dt ≤ L1`,`k_L1·dt ≥ 256B`;
|
||||
- 约束 3 搬移效率:`sM·k_L1·dt ≥ 16KB`,`k_L1·sN·dt ≥ 16KB`;
|
||||
- 约束 4:SingleCoreM/N 是 BaseM/N 的整数倍。
|
||||
(L0A/L0B 仍开双缓冲; 16 对齐是 Cube K 向粒度要求, L1→L0 搬移无 dValue 要求。)
|
||||
|
||||
选取策略:满足约束 1 前提下 SingleCoreM/N 尽量大,长宽比跟随 M/N。
|
||||
**Step 1: SingleCoreM/N + k_L1 + mCnt/nCnt**(有界枚举——v1.91 §5.2, 与尾轮 v1.5 §2.1
|
||||
修正口径一致)
|
||||
|
||||
SingleCoreM/N **不受 L0 容量直接约束**(内部由若干 BaseM×BaseN L0 tile 组成), 核心影响
|
||||
GM→L1 搬移效率与 L2 重复读率:
|
||||
|
||||
- **P = ⌈C/B⌉**(最少切分块数);
|
||||
- **P=1 (B ≥ C)**: 先试不切分 (mCnt=nCnt=1, tile 跟随 M/N); 约束不满足则强制切分, 进入枚举;
|
||||
- **枚举空间**(有界, host 端遍历): mCnt ∈ [1, ⌈M/BaseM⌉], nCnt ∈ [1, ⌈N/BaseN⌉],
|
||||
且 B·mCnt·nCnt ≥ C(约束 1 并行度);
|
||||
- 每候选: sM = align_up(⌈M/mCnt⌉, BaseM)(约束 4: BaseM 整数倍), sN 同理;
|
||||
- **约束 2**(L1 双缓冲): k_L1 = min(K, ⌊L1/(2(sM+sN)·dtype)⌋₁₆)(k_L1 与形状耦合);
|
||||
- **约束 3**(搬移效率, 转置感知): dValue ≥ 256B——A 非转置 k_L1·dt / A 转置 sM·dt;
|
||||
B 非转置 sN·dt / B 转置 k_L1·dt; 且单次搬移量 sM·k_L1·dt 与 k_L1·sN·dt ≥ 16KB;
|
||||
- **目标**: 每 batch 总搬入 `K·dt·(nCnt·M + mCnt·N)` 最小(v1.5 §2.1 修正: 稳态流水下
|
||||
k_L1 约掉——单块搬入 = K(sM+sN)·dt 与分次粒度无关, k_L1 只进约束);
|
||||
**并列时取 r = B·mCnt·nCnt mod C 最大**(尾轮块越多, 重切越省)。
|
||||
|
||||
mCnt = ⌈M/singleCoreM⌉, nCnt = ⌈N/singleCoreN⌉(按实际 tile 反推)。
|
||||
|
||||
**Step 2: mCnt/nCnt 与核间分配**:`mCnt=⌈M/sM⌉`,`nCnt=⌈N/sN⌉`,总块数 B·mCnt·nCnt,B→M→N 线性映射。
|
||||
|
||||
@@ -95,7 +115,7 @@ A 行块 block_a = a_b/m_cnt、B 列块 block_b = b_b/n_cnt。
|
||||
> 注:早期口径(预算 D = L2/(B·K·dt) 且对半切、组内窗口流量零计)已废弃
|
||||
> (issue#24 除总 B 的矛盾、issue#32 对半预算与窗口零计失真);分组不再对半、窗口复用如实计 L2。
|
||||
|
||||
**Step 6: 核内 tiling**:BaseM×BaseN×4B×DB ≤ L0C;BaseM×k_L0×dt×2 ≤ L0A;k_L0×BaseN×dt×2 ≤ L0B;内轴按 dValue 256B/512B 对齐。
|
||||
**Step 6: 核内 tiling**:BaseM×BaseN×4B ≤ L0C(UnitFlag 单缓冲, 见 Step 0);BaseM×k_L0×dt×2 ≤ L0A;k_L0×BaseN×dt×2 ≤ L0B;内轴按 dValue 256B/512B 对齐。
|
||||
|
||||
**Step 7: 内部特化**:单边无 batch 且该侧矩阵小时小侧整个常驻 L1 只搬一次。
|
||||
|
||||
|
||||
Reference in New Issue
Block a user