diff --git a/BMM算子优化分析_Release/BMM算子优化分析_v0.7.md b/BMM算子优化分析_Release/BMM算子优化分析_v0.7.md index ad1e00e..a0dade0 100644 --- a/BMM算子优化分析_Release/BMM算子优化分析_v0.7.md +++ b/BMM算子优化分析_Release/BMM算子优化分析_v0.7.md @@ -443,28 +443,36 @@ $$ ## 十、case 遍历:各分支的覆盖区域 -对 $B \in [1, 2048]$、$M,N,K \in [1, 10240]$ 按对数网格采样 20736 个 case,严格按上述进入条件分类(BF16),结果: +### 方法论说明 -### 分支覆盖统计 +**采样方式**:B ∈ [1, 2048] 全量遍历(2048 个值),M/N/K ∈ [1, 10240] 对数网格采样 60 点/维(值按指数增长:1, 2, 3, 5, 7, 10, 14, 19, 26, 35, ...)。总 case 数 3.2 亿,耗时约 4 分钟。 + +**为什么不做全量遍历**:全量 = 2048 × 10240³ ≈ 2.2×10¹⁵ 个 case。Python 分类器约需 1400 万小时,C 实现约需 6 万小时——完全不可行。对数采样在小值区密集、大值区稀疏,恰好覆盖了分支边界集中的区域。 + +**分布依赖测度**:对数均匀采样和线性均匀采样给出的分支占比**不同**。对数采样在小值区密集,特殊分支(K=0/1)、降核 ASW(P 小)、StreamK(K 大但 M/N 小)的占比被放大;线性采样被大 shape 主导(M/N/K > 512 占 [1,10240] 的 95%+),ASW_Basic 占比显著升高。**本文遍历的目的是验证覆盖性(无空洞),不是统计真实工作负载的分布。** + +### 分支覆盖统计(对数采样,B 全量 2048,M/N/K 60 点/维,共 3.2 亿 case) | 分支 | case 数 | 占比 | B 范围 | 区域特征 | |---|---|---|---|---| -| ASW_Basic | 7290 | 35.2% | 2 ~ 2048 | 通用:B