diff --git a/BMM算子优化分析_Release/BMM算子优化分析_v0.94.html b/BMM算子优化分析_Release/BMM算子优化分析_v0.94.html index 167f5cf..9a9ed76 100644 --- a/BMM算子优化分析_Release/BMM算子优化分析_v0.94.html +++ b/BMM算子优化分析_Release/BMM算子优化分析_v0.94.html @@ -403,7 +403,7 @@ $$
  • 窗口行边界(窗口0→窗口1):A 行整体换血(μ0..3 → μ4..7),此时 B 列带的连续性决定换血成本——不蛇形则下一窗口从 ν0 开始(LRU 上最久未用、早已被挤出 L2 的冷带),蛇形则延续上一窗口末尾的 ν7(最热线带)。蛇形只标在窗口行号上(源码 BatchMatMulAswBlock::UpdateBasicIndex:仅 rowIdx 为奇时 n 反向,窗内 m 最快序不反向),正是这个收益结构的直接实现。
  • 3、L2 切分(工作集超 L2 时)

    -

    切的是什么:L2 切分切的是输出平面——把 M×N 平面切成 mL2TileNum × nL2TileNum 个大矩形块(每块 = 若干基本块的集合),使"该块所需的 A 行带 + B 列带"输入工作集 ≤ L2 可用读入空间;块内所有输出基本块算完再进下一块,输入只在跨块时换一次。

    +

    切的是什么:将 mCnt×nCnt 个基本块划分为若干执行组——每组覆盖输出平面上一个连续矩形区域(若干 singleCoreM × singleCoreN 基本块的集合),使该组所需的 A 行带 + B 列带输入工作集 ≤ L2 可用读入空间;组内所有基本块算完再进下一组,输入只在跨组时换一次。

    为什么需要它:滑窗压缩的只是"同一波"的足迹;若整个工作集超 128MB L2,跨波次复用落空——上一波窗口的 A 行早被挤出,下一波又得回 GM 读。且 L2 是读写共用的:输出经 fixpipe 写出时若驻留 L2(dirty),会压缩读入可用空间;若直写 GM,则占用与读共享的 1.6TB/s 总线。所以 L2 切分必须与写出策略联合决策。记输入总量 $S_{in} = B(MK+KN)\cdot\text{dtype}$,输出总量 $S_{out} = B \cdot MN \cdot outB$。

    两个不变量(一切分析的起点):