v1.2: 同步HTML

This commit is contained in:
2026-08-27 07:49:54 +00:00
parent fcf6b58499
commit aa778ecd0c

View File

@@ -44,7 +44,7 @@ MathJax = {
<blockquote>目标芯片:昇腾 950PRDAV_3510。本文为 ASW_Basic 分支的独立分析自包含完整推导链。v1.2 修正 dValue 定义与尾轮重切约束,新增与源码实现的对比分析。</blockquote>
<h2>摘要</h2>
<p>ASW_Basic 是 BMM 的兜底分支——核间切 M/N或混合切不做 batch 合并或 K 维切分。本文给出完整的时延建模、核间分配策略分析(证明 B 优先分组在任何场景下都不优于线性映射)、实现方案的逐步推导,以及尾轮处理策略。</p>
<p>v1.2 新增 §七:与 [cann-ops-nn](https://gitcode.com/cann/ops-nn/tree/master/matmul/batch_mat_mul_v3) 源码实现的逐维度对比。核心结论:<b>源码的 swizzle、核间分配、AL1 全载与理论高度一致主要差距在降核模式未实现、IsCapable 无并行度校验、以及大量经验常数硬编码</b></p>
<p>v1.2 修正dValue 正确定义ND 连续维字节数)、尾轮重切约束分访存 Bound/计算 Bound 两级(计算 Bound 下 dValue 可放宽)、§七源码对比。核心结论:<b>源码的 swizzle、核间分配、AL1 全载与理论高度一致主要差距在降核模式未实现、IsCapable 无并行度校验、尾轮未按 Bound 类型区分重切策略</b></p>
<hr>
<h2>一、问题定义与执行模型</h2>
<h3>1.1 分支定位</h3>
@@ -170,7 +170,7 @@ $$</div>
</ol>
<p>因此 ASW_Basic 采用 <b>B→M→N 线性映射</b>作为核间分配策略。</p>
<hr>
<h2>五、尾轮处理</h2>
<h2>五、尾轮处理与负载均衡</h2>
<h3>5.1 尾轮的定义</h3>
<p>当 $B \cdot mCnt \cdot nCnt \;\%\; C \neq 0$ 时,总块数不能被 C 整除,最后一波(尾轮)不满载——只有 $B \cdot mCnt \cdot nCnt \;\%\; C$ 个核有活干,其余核空闲。</p>
<h3>5.2 尾轮重切:是否值得?</h3>
@@ -186,45 +186,47 @@ $$</div>
\frac{\Delta T_{saved}}{T_{total}} \approx \frac{1 - 1/s}{n_{wave}}
$$</div>
<p>$n_{wave} = 2$、$s = C/r$ 时:$r=16$ → 收益 25%$r=8$ → 收益 37.5%。$n_{wave} = 3$ 时:$r=16$ → 16.7%$r=8$ → 25%。**$n_{wave} \le 3$ 时收益显著,应重切。**</p>
<p>*重切约束的推导*:沿 N 切 $s$ 份后,小块变为 $[\text{singleCoreM},\; \text{singleCoreN}/s]$。B 矩阵搬移的 dValue 受影响ND 非转置时连续维为 N</p>
<div class="math">$$
\text{dValue}_B^{tail} = \frac{\text{singleCoreN}}{s} \cdot dtype
$$</div>
<p>A 矩阵搬移的 dValue 不受影响(连续维为 K$\text{dValue}_A = k_{L1} \cdot dtype$,与 M 向切分无关)。</p>
<p>小块须满足三类约束:</p>
<p>*重切约束的推导*:沿 N 切 $s$ 份后,小块变为 $[\text{singleCoreM},\; \text{singleCoreN}/s]$。小块须满足两类约束——<b>但约束的严格程度取决于算子是访存 Bound 还是计算 Bound</b></p>
<p>**访存 Bound$T_{MTE2} \ge T_{MMAD}$**:搬移是瓶颈,小块的 dValue 和搬移量不能降——否则搬移更慢,总时延反而增加。约束与主 tile 相同:</p>
<ol class="tight">
<li><b>dValue 下限</b>DMA 硬件突发效率):$\text{dValue}_B^{tail} \ge 256\text{B}$</li>
<li><b>dValue 下限</b>B 矩阵 dValue = $\text{singleCoreN}_{tail} \cdot dtype \ge 256\text{B}$(沿 N 切时)</li>
</ol>
<div class="math">$$
s \le \frac{\text{singleCoreN} \cdot dtype}{256\text{B}}
$$</div>
<ol class="tight">
<li><b>单次搬移量</b>带宽利用率保障B 矩阵单次搬移量 = $k_{L1} \cdot \text{singleCoreN}_{tail} \cdot dtype \ge min\_TileSize$(推荐 16KB</li>
<li><b>单次搬移量</b>$k_{L1} \cdot \text{singleCoreN}_{tail} \cdot dtype \ge min\_TileSize$</li>
</ol>
<div class="math">$$
s \le \frac{k_{L1} \cdot \text{singleCoreN} \cdot dtype}{min\_TileSize}
$$</div>
<ol class="tight">
<li><b>对齐</b>$\text{singleCoreN}_{tail} \ge 16$Cube 基本块 N 向粒度)</li>
<li><b>对齐</b>$\text{singleCoreN}_{tail} \ge 16$</li>
</ol>
<div class="math">$$
s \le \frac{\text{singleCoreN}}{16}
$$</div>
<p>沿 M 切时对称B 矩阵 dValue 不受影响(连续维 N 未变A 矩阵单次搬移量 $= \text{singleCoreM}_{tail} \cdot k_{L1} \cdot dtype \ge min\_TileSize$,对齐 $\text{singleCoreM}_{tail} \ge 16$。<b>沿 M 切无 dValue 约束</b>A 矩阵 dValue = $k_{L1} \cdot dtype$ 不变)。</p>
<p>*最优切分因子*:在不违反约束的前提下尽量让 $r \cdot s$ 接近 $C$</p>
<p>**计算 Bound$T_{MMAD} &gt; T_{MTE2}$**搬移被计算掩盖dValue 和搬移量约束可放宽——即使搬移效率降低,只要搬移时间仍 ≤ 计算时间,总时延不变。放宽的定量依据:</p>
<p>小块计算时延 $T_{comp}^{tail} = 2 \cdot \text{singleCoreM} \cdot \text{singleCoreN}_{tail} \cdot K / Q_{16}$,搬移时延 $T_{load}^{tail} = (\text{singleCoreM} + \text{singleCoreN}_{tail}) \cdot k_{L1} \cdot dtype / BW_{pc}$。搬移被掩盖的条件</p>
<div class="math">$$
s^* = \min\Big(\Big\lfloor \frac{C}{r} \Big\rfloor,\; \frac{\text{singleCoreN} \cdot dtype}{256\text{B}},\; \frac{k_{L1} \cdot \text{singleCoreN} \cdot dtype}{min\_TileSize},\; \frac{\text{singleCoreN}}{16}\Big)
T_{load}^{tail} \le T_{comp}^{tail} \iff \text{singleCoreN}_{tail} \ge \frac{\text{singleCoreM} \cdot k_{L1} \cdot dtype \cdot Q_{16}}{BW_{pc} \cdot (2 \cdot \text{singleCoreM} \cdot K - k_{L1} \cdot dtype \cdot Q_{16} / BW_{pc})}
$$</div>
<p>记右端为 $x_{min}$(搬移掩盖下限),则计算 Bound 下的约束为:</p>
<div class="math">$$
s \le \min\Big(\frac{\text{singleCoreN}}{x_{min}},\; \frac{\text{singleCoreN}}{16}\Big)
$$</div>
<p>**计算 Bound 越严重K 越大),$x_{min}$ 越小,$s$ 上限越大**——极端情况 $x_{min} \to 16$(对齐底线),$s \le \text{singleCoreN}/16$。</p>
<p>*例*singleCoreM=singleCoreN=256、$k_{L1}$=128、K=1024、BF16$x_{min} = 256 \times 128 \times 2 \times 15.2 \times 10^{12} / (50 \times 10^9 \times (2 \times 256 \times 1024 - 128 \times 2 \times 15.2 \times 10^{12} / 50 \times 10^9)) \approx 1$——几乎无约束,$s \le 256/16 = 16$。</p>
<p>*最优切分因子*:先判定 Bound 类型($T_{MMAD}$ vs $T_{MTE2}$),再选约束集:</p>
<div class="math">$$
s^* = \min\Big(\Big\lfloor \frac{C}{r} \Big\rfloor,\; s_{max}\Big),\qquad s_{max} = \begin{cases} \min\big(\frac{\text{singleCoreN} \cdot dtype}{256\text{B}},\; \frac{k_{L1} \cdot \text{singleCoreN} \cdot dtype}{min\_TileSize},\; \frac{\text{singleCoreN}}{16}\big) & \text{访存 Bound} \\ \frac{\text{singleCoreN}}{16} & \text{计算 Bound} \end{cases}
$$</div>
<p>*例*C=32、$N_{blk}=40$、$n_{wave}=2$、$r=8$、singleCoreM=singleCoreN=256、$k_{L1}$=128、BF16</p>
<ul class="tight">
<li>dValue$s \le 256 \times 2 / 256 = 2$</li>
<li>搬移量:$s \le 128 \times 256 \times 2 / 16384 = 4$</li>
<li>对齐:$s \le 256/16 = 16$</li>
<li>核数:$\lfloor 32/8 \rfloor = 4$</li>
<li><b>访存 Bound</b>K 小):dValue $s \le 2$,搬移量 $s \le 4$,对齐 $s \le 16$。$s^* = 2$——dValue 瓶颈16 核满载,尾波减半,总时延节省 25%。</li>
<li><b>计算 Bound</b>K 大):$x_{min} \approx 1$$s^* = \min(4, 16) = 4$——32 核满载,尾波降为 1/4总时延节省 37.5%。</li>
</ul>
<p>$s^* = \min(4, 2, 4, 16) = 2$——<b>dValue 约束是瓶颈</b>。尾轮 8 块沿 N 2 份 → 16 个小块(每块 [256, 128]dValue = 128×2 = 256B 恰好达标16 核满载,尾波时延从 $T_{block}$ 降至 $T_{block}/2$。总时延节省 25%</p>
<p>若 dValue 卡死导致 $r \cdot s^* &lt; C/2$(重切后仍不满半),改沿 M 切(无 dValue 约束M/N 都不可行时退化为不重切。</p>
<p>*切分方向选择*:优先沿 N 切(保持 A 行带完整L2 中 A 数据不变);若 N 向 dValue 约束太紧,改沿 M 切A 矩阵 dValue 不变,仅受搬移量和对齐约束)。</p>
<p>*切分方向选择*:优先沿 N 切(保持 A 行带完整L2 中 A 数据不变)。计算 Bound 下若 N 向对齐卡住($\text{singleCoreN}/16 &lt; C/r$),改沿 MA 矩阵 dValue = $k_{L1} \cdot dtype$ 不变,仅受对齐约束 $\text{singleCoreM}/16$</p>
<p><b>结论</b>$n_{wave} \le 3$ 且 $r &lt; C$ 时应重切尾轮——host 端零代价NPU 端收益 $T_{block}(1-1/s^*)$。$n_{wave} \ge 4$ 时收益 &lt; 25%,可不重切(通过选择使尾波占比小的 mCnt/nCnt 组合来优化)。</p>
<h3>5.3 尾轮影响的量化</h3>
<p>设总块数 $N_{blk} = B \cdot mCnt \cdot nCnt$,总波数 $n_{wave} = \lceil N_{blk} / C \rceil$,尾波块数 $r = N_{blk} \bmod C$$r = 0$ 时无尾波)。</p>