PPT: θ≈12, 8192=dValue推荐值

This commit is contained in:
2026-08-24 00:20:55 +00:00
parent e1a0fb80c8
commit 206c8e18c8

View File

@@ -180,8 +180,8 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c
<p>收益判据T_Reduce &lt; T_pipe(11/grid_K)T_pipe = max(T_MTE2, T_MMAD)</p>
<p>⟺ T_pipe &gt; grid_K/(grid_K1)·T_Reduceα=grid_K/(grid_K1)grid_K=2 时 α=2</p>
<p class="sub">StreamK case 多为访存 BoundAI &lt; R₁₆T_pipe = T_MTE2 是瓶颈</p>
<p style="margin-top:8px"><span class="eq">K &gt; grid_K²/(grid_K1) × 11</span> grid_K=2→K>494→K>628→K>102</p>
<p class="sub">源码固定门槛 8192 远高于归约阈值(~50~360其动机是摊薄固定开销workspace、同步、AIV启动</p>
<p style="margin-top:8px"><span class="eq">K &gt; grid_K²/(grid_K1) × 12</span> grid_K=2→K>494→K>668→K>112</p>
<p class="sub">源码 8192 = C×512B = dValue 推荐值在最大 grid_K=C 下的保障条件2非归约代价条件3阈值仅 ~50~400</p>
</div>
<!-- Slide 11: ASW 1 -->
@@ -241,7 +241,7 @@ body{font-family:"PingFang SC","Microsoft YaHei",sans-serif;background:#0f172a;c
<ul>
<li><b>经验常数</b>min_TileSize=16KB、480KB、均衡率 0.8、CUBE_BOUND_RATIO 0.85 等)为该芯片档实测值,换芯片需重新标定</li>
<li><b>重叠区</b>MergeBatch vs IterBatch 在 M×N 中段)的归属由端到端时延模型 $T_{total}$ 精确仲裁,文档条件给出的是"主场"</li>
<li><b>StreamK θ≈11</b> 基于 L2 5.2TB/s 推导,若 workspace 落 GM 则升至 ~87源码 8192 门槛由固定开销主导</li>
<li><b>StreamK θ≈12</b> 基于 L2 5.2TB/s 推导,若 workspace 落 GM 则升至 ~97源码 8192 门槛由 dValue 推荐值主导</li>
</ul>
<p style="margin-top:16px;font-size:24px;text-align:center;color:#38bdf8"><b>整体评价:逻辑体系完整,推导自洽,可指导工程实现</b></p>
</div>