Fix T_cmd=0 robustness: beats_iterbatch 阈值除零防护 (T_cmd<=0 判 MergeBatch 不胜出, 无命令节省) + 3 条回归测试
This commit is contained in:
@@ -7,6 +7,8 @@
|
||||
核心思想: 合并 b0 个 batch 的 A'[b0*M,K] @ B'[K,b0*N] 为单次 DMA 搬入,
|
||||
减少 GM->L1 搬移命令数 (省 b0 倍 T_cmd); 交叉项被算出但丢弃 (冗余比例 (b0-1)/b0),
|
||||
进入条件 5 保证 case 为访存 Bound, 冗余算力被搬移时延掩盖.
|
||||
T_cmd=0 时 (无命令固定开销) 合并失去唯一收益来源, 分界仲裁直接判 MergeBatch
|
||||
不胜出 (beats_iterbatch 对 T_cmd<=0 做 +inf 处理, 见函数内说明).
|
||||
"""
|
||||
|
||||
from __future__ import annotations
|
||||
@@ -222,6 +224,8 @@ class MergeBatchBranch(Branch):
|
||||
|
||||
MergeBatch 最优 ⟺ K截断 (k_L1=K) 且 b_core > b0*(T_comp+T_write)/T_cmd
|
||||
L1 绑定情形 MergeBatch 恒劣于 IterBatch (搬移次数相同, 只放大 drain).
|
||||
T_cmd=0 时阈值趋于无穷: 合并的唯一收益 (省 DMA 命令开销) 消失,
|
||||
只剩 drain 放大与冗余计算, MergeBatch 无胜出通道 (见 evaluate 对拍也一致).
|
||||
"""
|
||||
s = self.spec
|
||||
m, n, k = case.m, case.n, case.k
|
||||
@@ -237,12 +241,21 @@ class MergeBatchBranch(Branch):
|
||||
b0 = plan.merge_b0
|
||||
t_comp = 2.0 * m * n * min(k_l1_iter, k) / s.q16
|
||||
t_write = m * n * out_b / s.bw_pc
|
||||
drain_pen = (b0 - 1) * (t_comp + t_write)
|
||||
|
||||
if s.t_cmd <= 0:
|
||||
# T_cmd=0: 阈值 b0*(T_comp+T_write)/T_cmd -> +inf, 不可除零, 直接判负
|
||||
detail = (f"k_L1={'K(截断)' if k_truncated else f'{k_l1_iter:.0f}<K(L1绑定)'}; "
|
||||
f"T_cmd=0: 合并无命令开销节省 (阈值=+inf), MergeBatch 无胜出通道; "
|
||||
f"仅剩 drain 惩罚=(b0-1)*(T_comp+T_write)={drain_pen*1e6:.2f}us")
|
||||
return False, detail
|
||||
|
||||
threshold = b0 * (t_comp + t_write) / s.t_cmd
|
||||
|
||||
win = k_truncated and (b_core > threshold)
|
||||
detail = (f"k_L1={'K(截断)' if k_truncated else f'{k_l1_iter:.0f}<K(L1绑定)'}; "
|
||||
f"b_core={b_core} vs 阈值 b0*(T_comp+T_write)/T_cmd={threshold:.1f}; "
|
||||
f"drain惩罚=(b0-1)*(T_comp+T_write)={((b0-1)*(t_comp+t_write))*1e6:.2f}us, "
|
||||
f"drain惩罚=(b0-1)*(T_comp+T_write)={drain_pen*1e6:.2f}us, "
|
||||
f"搬移节省=b_core*(1-1/b0)*T_cmd={b_core*(1-1/b0)*s.t_cmd*1e6:.2f}us")
|
||||
return win, detail
|
||||
|
||||
|
||||
Reference in New Issue
Block a user