v0.6 修订:数值精确化

This commit is contained in:
2026-08-23 03:10:08 +00:00
parent 6fc8946903
commit f843a2fa3d

View File

@@ -374,7 +374,7 @@ $$
**场景 A$S_{in} + S_{out} \le L2$(全驻留)**输入读一遍$r_{in}=1$输出驻留 L2dirty异步回写 GM——写出走 5.2TB/s L2 写口不与读争也削平了 GM 写突发无需切分 **场景 A$S_{in} + S_{out} \le L2$(全驻留)**输入读一遍$r_{in}=1$输出驻留 L2dirty异步回写 GM——写出走 5.2TB/s L2 写口不与读争也削平了 GM 写突发无需切分
**场景 B$S_{in} \le L2$ 但 $S_{in} + S_{out} > L2$(输入能驻留,加上输出超了)**。**输入驻留输出直写 GM**fixpipe L0CGM不占 L2保住 $r_{in}=1$校验总线$(S_{in} + S_{out})/T_{MMAD} \le W_{GM}$。B=8、M=N=4096、K=512、BF16——$S_{in}$=64MB L2$S_{out}$=256MB 直写 GMT_MMAD318µs总流量速率 (64+256)MB/318µs 1.06TB/s < 1.6TB/s ✓。 **场景 B$S_{in} \le L2$ 但 $S_{in} + S_{out} > L2$(输入能驻留,加上输出超了)**。**输入驻留输出直写 GM**fixpipe L0CGM不占 L2保住 $r_{in}=1$校验总线$(S_{in} + S_{out})/T_{MMAD} \le W_{GM}$。B=8、M=N=4096、K=512、BF16——$S_{in}$≈67MB L2$S_{out}$268MB 直写 GMT_MMAD318µs总流量速率 (67+268)MB/318µs 1.05TB/s < 1.6TB/s ✓。
**场景 C$S_{in} > L2$(输入本身超)**必须 L2 切分输出直写 GM 以最大化 $L2_{read}$切分数满足 **场景 C$S_{in} > L2$(输入本身超)**必须 L2 切分输出直写 GM 以最大化 $L2_{read}$切分数满足
@@ -388,7 +388,7 @@ $$
transConflict = \max\big(\lceil C / mCnt \rceil,\; \lceil C / nCnt \rceil\big) \le 6 transConflict = \max\big(\lceil C / mCnt \rceil,\; \lceil C / nCnt \rceil\big) \le 6
$$ $$
即同一时刻并发核访问同一 A/B 块的最大冲突数不超过阈值经验值 6切分方案中优先选尾波不满载占比小拖尾 < 一半遍历大方向由 calOrder 决定0=M 优先1=N 优先按形状选共享矩阵更能驻留 L2 的方向B=64、M=N=2048、K=1024、BF16——$S_{in}$=512MB > L2输出直写$L2_{read}$=128MB切 3×2=6 块(每块输入约 89MB ≤ 128MB总流量 1GBT_MMAD≈1.27ms,速率 844GB/s < 1.6TB/s ✓。 即同一时刻并发核访问同一 A/B 块的最大冲突数不超过阈值经验值 6切分方案中优先选尾波不满载占比小拖尾 < 一半遍历大方向由 calOrder 决定0=M 优先1=N 优先按形状选共享矩阵更能驻留 L2 的方向B=64、M=N=2048、K=1024、BF16——$S_{in}$≈537MB > L2输出直写$L2_{read}$=128MB切 3×2=6 块(每块输入约 89MB ≤ 128MB总流量 1.07GBT_MMAD≈1.27ms,速率 844GB/s < 1.6TB/s ✓。
补充若输出会被后续算子立即消费融合场景输出驻留 L2 让下游读命中场景 B/C 的策略反过来本文按单算子边界分析 补充若输出会被后续算子立即消费融合场景输出驻留 L2 让下游读命中场景 B/C 的策略反过来本文按单算子边界分析