[P1] 切M/N(ASW) 的共享块重复读未按 L2 带宽计时;场景判定与分组预算 D 错误除以总 batch 数 #24

Closed
opened 2026-09-04 03:38:05 +00:00 by admin · 1 comment
Owner

架构口径(用户澄清 + docs/02_分支理论/06_ASW_Basic分支.md §3:线性映射同一时刻只激活 1 个 batch):数据块首读走 GM(按 GM 带宽,随路可驻留 L2,不叠加 L2 时延);驻留后再被其它核读取时按 L2 带宽(5.2TB/s 读口独享)计时,即单块全核共享 = GM 读 1 次 + L2 读 (C-1) 次。切 M/N 的一般情形:A 行块被 n_cnt 个 tile 读取 → GM 1 次 + L2 (n_cnt-1) 次;B 列块对称 (m_cnt-1) 次。
现状问题:

  1. asw evaluate 的 l2_read_bytes 恒为 0(场景 A/B r_in=1 时把重复读当免费);README 声明的"驻留 L2 后重复读按 L2 带宽"未实现;
  2. 场景 A/B/C 用总输入量 B·S_in 判定(应为单 batch/当前工作集口径);
  3. 场景 C 分组预算 D = L2/(B·K·dt) 除以总 batch 数,与"同一时刻单 batch 激活"矛盾:同几何 M=N=4096/K=1024、每 batch 16.8MB 时,B=8→r_in=1,B=16→3,B=64→12(每 batch GM 当量 10.5→126us),存在跨边界 3x 突跳。
    期望:按块级两段建模(GM 一次 + L2 复用次数),场景按单 batch 工作集判定,场景 C 预算不除以 B;Fixpipe→L2 输出走 5.2TB/s 写口独立计时。
架构口径(用户澄清 + docs/02_分支理论/06_ASW_Basic分支.md §3:线性映射同一时刻只激活 1 个 batch):数据块首读走 GM(按 GM 带宽,随路可驻留 L2,不叠加 L2 时延);驻留后再被其它核读取时按 L2 带宽(5.2TB/s 读口独享)计时,即单块全核共享 = GM 读 1 次 + L2 读 (C-1) 次。切 M/N 的一般情形:A 行块被 n_cnt 个 tile 读取 → GM 1 次 + L2 (n_cnt-1) 次;B 列块对称 (m_cnt-1) 次。 现状问题: 1. asw evaluate 的 l2_read_bytes 恒为 0(场景 A/B r_in=1 时把重复读当免费);README 声明的"驻留 L2 后重复读按 L2 带宽"未实现; 2. 场景 A/B/C 用总输入量 B·S_in 判定(应为单 batch/当前工作集口径); 3. 场景 C 分组预算 D = L2/(B·K·dt) 除以总 batch 数,与"同一时刻单 batch 激活"矛盾:同几何 M=N=4096/K=1024、每 batch 16.8MB 时,B=8→r_in=1,B=16→3,B=64→12(每 batch GM 当量 10.5→126us),存在跨边界 3x 突跳。 期望:按块级两段建模(GM 一次 + L2 复用次数),场景按单 batch 工作集判定,场景 C 预算不除以 B;Fixpipe→L2 输出走 5.2TB/s 写口独立计时。
Author
Owner

【修复说明 · 乱码重写】原评论提交时编码损坏、内容不可恢复, 以下按 git 记录 / issue 正文 / 残留文本重建 (要点级, 非逐字原稿):

[P1] 切M/N(ASW) 共享块重复读未按 L2 带宽计时 / 场景判定与分组预算错误除总 B 已修复 (commit 4843053):

  • ASW evaluate 块级模型: A 行块被 n_cnt 个 tile 读取 → GM 首读 1 次 + L2 重复读
    (n_cnt-1) 次 (B 列块对称 (m_cnt-1) 次), 按 L2 读口 5.2TB/s 计时;
  • 场景 A/B/C 判定与分组预算 D 改按单 batch 工作集 (线性映射同一时刻单 batch 激活),
    不再除以总 batch 数 (消除 06 文档 §3 与 Step5 内部矛盾);
  • 复验与扩大集 44 例同步重算。
【修复说明 · 乱码重写】原评论提交时编码损坏、内容不可恢复, 以下按 git 记录 / issue 正文 / 残留文本重建 (要点级, 非逐字原稿): [P1] 切M/N(ASW) 共享块重复读未按 L2 带宽计时 / 场景判定与分组预算错误除总 B 已修复 (commit 4843053): - ASW evaluate 块级模型: A 行块被 n_cnt 个 tile 读取 → GM 首读 1 次 + L2 重复读 (n_cnt-1) 次 (B 列块对称 (m_cnt-1) 次), 按 L2 读口 5.2TB/s 计时; - 场景 A/B/C 判定与分组预算 D 改按**单 batch 工作集** (线性映射同一时刻单 batch 激活), 不再除以总 batch 数 (消除 06 文档 §3 与 Step5 内部矛盾); - 复验与扩大集 44 例同步重算。
admin closed this issue 2026-09-04 03:43:39 +00:00
Sign in to join this conversation.
No Label
1 Participants
Notifications
Due Date
No due date set.
Dependencies

No dependencies set.

Reference: admin/matmul-analysis#24
No description provided.