PPT 同步修正 StreamK 归约条件
This commit is contained in:
@@ -177,9 +177,11 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c
|
||||
第3步:AIV 从 L2 读回各段部分和到 UB,向量求和,写回
|
||||
(AIV 独立硬件,数据流 GM/L2→UB→AIV→UB→L2/GM)</div>
|
||||
<p style="margin-top:10px">归约时延 = 写部分和 + AIV 读回 + AIV 求和 + 写回,四段之和</p>
|
||||
<p>要求计算时延 ≥ 归约时延 × 10 → <span class="eq">K ≥ grid_K² × 109</span></p>
|
||||
<p>grid_K=2→K≥0.5K;4→1.8K;8→7.0K;32→112K</p>
|
||||
<p class="sub">源码固定门槛 8192 ≈ 本模型 grid_K≤8 的要求,互为印证</p>
|
||||
<p>收益判据:T_Reduce < T_pipe(1−1/grid_K),T_pipe = max(T_MTE2, T_MMAD)</p>
|
||||
<p>⟺ T_pipe > grid_K/(grid_K−1)·T_Reduce(α=grid_K/(grid_K−1),grid_K=2 时 α=2)</p>
|
||||
<p class="sub">StreamK case 多为访存 Bound(AI < R₁₆),T_pipe = T_MTE2 是瓶颈</p>
|
||||
<p style="margin-top:8px"><span class="eq">K > grid_K²/(grid_K−1) × 11</span> grid_K=2→K>49;4→K>62;8→K>102</p>
|
||||
<p class="sub">源码固定门槛 8192 远高于归约阈值(~50~360),其动机是摊薄固定开销(workspace、同步、AIV启动)</p>
|
||||
</div>
|
||||
|
||||
<!-- Slide 11: ASW 1 -->
|
||||
@@ -239,7 +241,7 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c
|
||||
<ul>
|
||||
<li><b>经验常数</b>(min_TileSize=16KB、480KB、均衡率 0.8、CUBE_BOUND_RATIO 0.85 等)为该芯片档实测值,换芯片需重新标定</li>
|
||||
<li><b>重叠区</b>(MergeBatch vs IterBatch 在 M×N 中段)的归属由端到端时延模型 $T_{total}$ 精确仲裁,文档条件给出的是"主场"</li>
|
||||
<li><b>StreamK θ=109</b> 基于 L2 5.2TB/s 推导,若 workspace 落 GM 则退回 θ≈1700</li>
|
||||
<li><b>StreamK θ≈11</b> 基于 L2 5.2TB/s 推导,若 workspace 落 GM 则升至 ~87;源码 8192 门槛由固定开销主导</li>
|
||||
</ul>
|
||||
<p style="margin-top:16px;font-size:24px;text-align:center;color:#38bdf8"><b>整体评价:逻辑体系完整,推导自洽,可指导工程实现</b></p>
|
||||
</div>
|
||||
|
||||
Reference in New Issue
Block a user