diff --git a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html index ad3d419..6e2440e 100644 --- a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html +++ b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html @@ -144,8 +144,9 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c
为何不允许 b_core=2?合并后每核仅 1 组,与 IterBatch(b_core=2) 总搬移时延相同,但多 50% 冗余计算——无收益
典型:B=128, M=N=64, K=512 → MergeBatch;K=256 → 单核搬移不够 480KB → IterBatch