diff --git a/BMM算子优化分析_Release/BMM算子优化分析_v0.91.md b/BMM算子优化分析_Release/BMM算子优化分析_v0.91.md index 7426da4..98399ef 100644 --- a/BMM算子优化分析_Release/BMM算子优化分析_v0.91.md +++ b/BMM算子优化分析_Release/BMM算子优化分析_v0.91.md @@ -179,7 +179,7 @@ $$ **分界条件**(MergeBatch 优于 IterBatch 当且仅当 $\Delta = T_{mb} - T_{iter} < 0$): $$b_{core} > \frac{b_0 \cdot \text{penalty}}{T_{bd}},\qquad - \text{penalty} = \begin{cases} (b_0-1)(T_{comp} + T_{write}) & \text{L1 绑定(}k_{L1} < K\text{)} \\ (b_0^2-1)T_{comp} + (b_0-1)T_{write} & \text{K 截断(}k_{L1} = K\text{)} \end{cases}$$ + \text{penalty} = \begin{cases} (b_0-1)(T_{comp} + T_{write}) & \text{L1 绑定(}k_{L1} \lt K\text{)} \\ (b_0^2-1)T_{comp} + (b_0-1)T_{write} & \text{K 截断(}k_{L1} = K\text{)} \end{cases}$$ K 截断时 MergeBatch 的 $k_{L1}$ 不减半 → 每分块计算量 $b_0^2$ 倍(而非 $b_0$ 倍)→ drain 惩罚更大。小 MN 时 $T_{comp}$ 小 → penalty 小 → MergeBatch 更容易赢;大 B 时 $b_{core}$ 大 → 边界节省多 → MergeBatch 更容易赢。