[P1] GM 读写共享总线未建模:MTE2 读与 Fixpipe 直写 GM 并发时需按 (读+写)/1.6TB/s 累加计时 #23
Reference in New Issue
Block a user
No description provided.
Delete Branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
架构口径(昇腾NPU知识库白皮书 + 用户澄清):GM 1.6TB/s 为读写共享总带宽,读+写合计不能超过;若同时刻 Fixpipe 也写出 GM,无法精确拆分读写占用,则该时延累加 = 并发读写总数据量 / GM带宽。
现状:各分支把 MTE2 读时延与 Fixpipe 直写 GM 时延作为独立流水级各自除以 GM 全带宽再取 max(隐含给读写各分配 1.6TB/s)。复评证据:B=4 M=131072 N=128 K=128 bf16(ASW):R=W≈128MB,模型 T=84.1us(t_mte2=84.1 与 t_fixpipe=83.9 不竞争),而共享总线下限 (R+W)/1.6TB/s=167.9us —— 低估 ~2×(未计 bus turnaround)。
期望:稳态级增加 GM 总线聚合:t_GM总线 = (GM读字节 + 直写GM字节)/1.6TB/s,与 L2 读段(5.2TB/s 独享)、MMAD、Fixpipe→L2 写段(5.2TB/s 写口独享)等取 max;L2 读/写端口各自独享互不竞争。
【修复说明 · 乱码重写】原评论提交时编码损坏、内容不可恢复, 以下按 git 记录 / issue 正文 / 残留文本重建 (要点级, 非逐字原稿):
[P1] GM 读写共享总线未建模 已修复 (commit
4843053):累加计时 (GM 为读写共享总线, 读+写合计不能超 1.6TB/s) + L2 重复读段 (5.2TB/s 读口) +
DMA 命令开销, 合并为单一稳态级;