From 17763f0bed16458319534f4e3bdd328d77060138 Mon Sep 17 00:00:00 2001 From: admin Date: Sun, 23 Aug 2026 12:00:37 +0000 Subject: [PATCH] =?UTF-8?q?=E7=AC=AC=E5=8D=81=E7=AB=A0=EF=BC=9A=E5=8A=A0?= =?UTF-8?q?=E6=96=B9=E6=B3=95=E8=AE=BA=E8=AF=B4=E6=98=8E=E3=80=81=E5=AF=86?= =?UTF-8?q?=E9=9B=86=E9=87=87=E6=A0=B7=EF=BC=883.2=E4=BA=BFcase=EF=BC=89?= =?UTF-8?q?=E3=80=81=E7=BA=BF=E6=80=A7=E5=AF=B9=E6=AF=94?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- .../BMM算子优化分析_v0.7.md | 46 +++++++++++-------- 1 file changed, 27 insertions(+), 19 deletions(-) diff --git a/BMM算子优化分析_Release/BMM算子优化分析_v0.7.md b/BMM算子优化分析_Release/BMM算子优化分析_v0.7.md index ad1e00e..a0dade0 100644 --- a/BMM算子优化分析_Release/BMM算子优化分析_v0.7.md +++ b/BMM算子优化分析_Release/BMM算子优化分析_v0.7.md @@ -443,28 +443,36 @@ $$ ## 十、case 遍历:各分支的覆盖区域 -对 $B \in [1, 2048]$、$M,N,K \in [1, 10240]$ 按对数网格采样 20736 个 case,严格按上述进入条件分类(BF16),结果: +### 方法论说明 -### 分支覆盖统计 +**采样方式**:B ∈ [1, 2048] 全量遍历(2048 个值),M/N/K ∈ [1, 10240] 对数网格采样 60 点/维(值按指数增长:1, 2, 3, 5, 7, 10, 14, 19, 26, 35, ...)。总 case 数 3.2 亿,耗时约 4 分钟。 + +**为什么不做全量遍历**:全量 = 2048 × 10240³ ≈ 2.2×10¹⁵ 个 case。Python 分类器约需 1400 万小时,C 实现约需 6 万小时——完全不可行。对数采样在小值区密集、大值区稀疏,恰好覆盖了分支边界集中的区域。 + +**分布依赖测度**:对数均匀采样和线性均匀采样给出的分支占比**不同**。对数采样在小值区密集,特殊分支(K=0/1)、降核 ASW(P 小)、StreamK(K 大但 M/N 小)的占比被放大;线性采样被大 shape 主导(M/N/K > 512 占 [1,10240] 的 95%+),ASW_Basic 占比显著升高。**本文遍历的目的是验证覆盖性(无空洞),不是统计真实工作负载的分布。** + +### 分支覆盖统计(对数采样,B 全量 2048,M/N/K 60 点/维,共 3.2 亿 case) | 分支 | case 数 | 占比 | B 范围 | 区域特征 | |---|---|---|---|---| -| ASW_Basic | 7290 | 35.2% | 2 ~ 2048 | 通用:B