From 73b9cb2b060f0620e375efd8f97a46478eb5fd1e Mon Sep 17 00:00:00 2001 From: admin Date: Mon, 24 Aug 2026 03:24:09 +0000 Subject: [PATCH] =?UTF-8?q?PPT:=20MergeBatch=20b=5Fcore=3D2=20=E8=AF=B4?= =?UTF-8?q?=E6=98=8E?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html | 3 ++- 1 file changed, 2 insertions(+), 1 deletion(-) diff --git a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html index ad3d419..6e2440e 100644 --- a/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html +++ b/BMM算子优化分析_Release/BMM算子优化分析_v0.7_讲解PPT.html @@ -144,8 +144,9 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c
  • 合并块输出 ≤ L0C(b₀²·MN·4B·2 ≤ 256KB)
  • 单核搬移总量 ≥ 480KB(保证 GM 带宽利用率)
  • 搬移 tile ≥ 16KB(单次搬移效率下限)
  • -
  • 2MN/(M+N) < R₁₆/b₀(访存 Bound,保证浪费被掩盖)
  • +
  • 2MN/(M+N) < R₁₆/b₀(访存 Bound,保证浪费被掩盖)
  • +

    为何不允许 b_core=2?合并后每核仅 1 组,与 IterBatch(b_core=2) 总搬移时延相同,但多 50% 冗余计算——无收益

    典型:B=128, M=N=64, K=512 → MergeBatch;K=256 → 单核搬移不够 480KB → IterBatch