diff --git a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html index 1b6ccc6..ad3d419 100644 --- a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html +++ b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html @@ -180,8 +180,8 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c

收益判据:T_Reduce < T_pipe(1−1/grid_K),T_pipe = max(T_MTE2, T_MMAD)

⟺ T_pipe > grid_K/(grid_K−1)·T_Reduce(α=grid_K/(grid_K−1),grid_K=2 时 α=2)

StreamK case 多为访存 Bound(AI < R₁₆),T_pipe = T_MTE2 是瓶颈

-

K > grid_K²/(grid_K−1) × 11 grid_K=2→K>49;4→K>62;8→K>102

-

源码固定门槛 8192 远高于归约阈值(~50~360),其动机是摊薄固定开销(workspace、同步、AIV启动)

+

K > grid_K²/(grid_K−1) × 12 grid_K=2→K>49;4→K>66;8→K>112

+

源码 8192 = C×512B = dValue 推荐值在最大 grid_K=C 下的保障(条件2),非归约代价(条件3阈值仅 ~50~400)

@@ -241,7 +241,7 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c

整体评价:逻辑体系完整,推导自洽,可指导工程实现