diff --git a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html index 4276ba6..1326589 100644 --- a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html +++ b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html @@ -169,7 +169,8 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c

9. StreamK — K 维核间切分

思路:B/M/N 都填不满核时,把 K 切给多个核各算一段,再归约

-

进入条件:P = B·MN·4B/L0C < 32;K/grid_K ≥ 128 元素(dValue 256B)

+

进入条件:P = B·MN·4B/L0C < 16(=C/2);K/grid_K ≥ 128 元素(dValue 256B)

+

阈值取 C/2:grid_K≥2 时每块需 2 核,P×2 ≤ C 才放得下

归约代价(按实现流程推导):

第1步:grid_K 个 AIC 各算 K/grid_K 段,L0C 原地累加 第2步:fixpipe 写部分和到 workspace(驻留 L2,走 5.2TB/s 写口)