diff --git a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html index 1326589..1b6ccc6 100644 --- a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html +++ b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html @@ -177,9 +177,11 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c 第3步:AIV 从 L2 读回各段部分和到 UB,向量求和,写回 (AIV 独立硬件,数据流 GM/L2→UB→AIV→UB→L2/GM)
归约时延 = 写部分和 + AIV 读回 + AIV 求和 + 写回,四段之和
-要求计算时延 ≥ 归约时延 × 10 → K ≥ grid_K² × 109
-grid_K=2→K≥0.5K;4→1.8K;8→7.0K;32→112K
-源码固定门槛 8192 ≈ 本模型 grid_K≤8 的要求,互为印证
+收益判据:T_Reduce < T_pipe(1−1/grid_K),T_pipe = max(T_MTE2, T_MMAD)
+⟺ T_pipe > grid_K/(grid_K−1)·T_Reduce(α=grid_K/(grid_K−1),grid_K=2 时 α=2)
+StreamK case 多为访存 Bound(AI < R₁₆),T_pipe = T_MTE2 是瓶颈
+K > grid_K²/(grid_K−1) × 11 grid_K=2→K>49;4→K>62;8→K>102
+源码固定门槛 8192 远高于归约阈值(~50~360),其动机是摊薄固定开销(workspace、同步、AIV启动)
@@ -239,7 +241,7 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c整体评价:逻辑体系完整,推导自洽,可指导工程实现