Fix #40: 切换 Cube 算力为白皮书 Cube-only 口径 (单核统一 13.5T)
用户裁决: cube_peak_tflops 取白皮书表3-1 "Cube算力" 单行 (不含 Vector)。
- 数值: 950PR 486->432, 950PR_C28 425->378, 950DT 547->486,
950DT_C32 486->432, 950DT_C28 425->378; 单核全系列精确 13.5T
(16^3 MAC/拍 x 1.65GHz), 28 核档 0.06% 取整偏差随之消失
- 传导 (无结构改动, 全部经 q16/q_cube/r16 派生):
MMAD 时延 x486/432 (+12.5%); R16 607.5->540 (MergeBatch 条件5/b0 上限);
StreamK θ_c 12.24->10.9; ASW 面积/周长分界 93.5->83.1, MMAD/FIX 304->270
- 文档同步: README, docs/00 (R16 公式), 04 (607.5 实例), 05 (硬件事实/复核算例),
06/07 (翻出阈值 187->166), 05_StreamK (θ_c 及 K 阈值 396->360);
理论归档 (BMM算子优化分析_Release/) 与历史测评报告不动
- 验证: 单测 88/88; examples 重生成 —— recommend 27/44 行变化
(计算Bound 行精确 +12.5%; b8_m32768_n2048_k512 瓶颈 MTE2->MMAD 翻转;
17 行访存主导不变), plans.csv 仅 merge_demo_k_trunc note 的算存比上限
23.7->21.1 一处文案; 压力回归 10000 例干净, MergeBatch 386->392 /
IterBatch 2389->2384 (R16 下移致 b0 上限收小, 边界 case 换边, 预期行为)