From ca6120b93808677e3b014c426a994391172ee772 Mon Sep 17 00:00:00 2001 From: admin Date: Sun, 23 Aug 2026 23:50:44 +0000 Subject: [PATCH] =?UTF-8?q?PPT=20=E5=90=8C=E6=AD=A5=E4=BF=AE=E6=AD=A3=20St?= =?UTF-8?q?reamK=20=E5=BD=92=E7=BA=A6=E6=9D=A1=E4=BB=B6?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- .../BMM算子优化分析_v0.7_讲解PPT.html | 10 ++++++---- 1 file changed, 6 insertions(+), 4 deletions(-) diff --git a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html index 1326589..1b6ccc6 100644 --- a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html +++ b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html @@ -177,9 +177,11 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c 第3步:AIV 从 L2 读回各段部分和到 UB,向量求和,写回 (AIV 独立硬件,数据流 GM/L2→UB→AIV→UB→L2/GM)

归约时延 = 写部分和 + AIV 读回 + AIV 求和 + 写回,四段之和

-

要求计算时延 ≥ 归约时延 × 10 → K ≥ grid_K² × 109

-

grid_K=2→K≥0.5K;4→1.8K;8→7.0K;32→112K

-

源码固定门槛 8192 ≈ 本模型 grid_K≤8 的要求,互为印证

+

收益判据:T_Reduce < T_pipe(1−1/grid_K),T_pipe = max(T_MTE2, T_MMAD)

+

⟺ T_pipe > grid_K/(grid_K−1)·T_Reduce(α=grid_K/(grid_K−1),grid_K=2 时 α=2)

+

StreamK case 多为访存 Bound(AI < R₁₆),T_pipe = T_MTE2 是瓶颈

+

K > grid_K²/(grid_K−1) × 11 grid_K=2→K>49;4→K>62;8→K>102

+

源码固定门槛 8192 远高于归约阈值(~50~360),其动机是摊薄固定开销(workspace、同步、AIV启动)

@@ -239,7 +241,7 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c

整体评价:逻辑体系完整,推导自洽,可指导工程实现