切换 Cube 算力为白皮书 Cube-only 口径 (PR32=432/DT36=486, 单核统一 13.5T) #40

Closed
opened 2026-09-09 02:48:59 +00:00 by admin · 1 comment
Owner

用户裁决

issue#38 遗留的口径问题, 用户裁决: 使用 Cube 核应用的 Cube-only 口径 —— cube_peak_tflops 取白皮书表3-1 "Cube算力" 单行 (不含 Vector)。

变更值 (白皮书表3-1)

SKU 旧 (Cube+Vector 总) 新 (Cube-only)
Ascend950PR (32核) 486 432
Ascend950PR_C28 425 378
Ascend950DT (36核) 547 486
Ascend950DT_C32 486 432
Ascend950DT_C28 425 378

单核 Cube BF16 全系列精确统一为 13.5 TFLOPS (= 16³ MAC/拍 × 1.65GHz; 432/32=378/28=486/36=13.5, 28 核档原 0.06% 取整偏差随之消失)。

影响面 (预期, 数值均经 q16/q_cube/r16 派生自动传导, 无结构改动)

  1. MMAD 时延全量 +12.5% (×486/432): t_mmad / drain / beats 阈值 T_comp / StreamK θ_c;
  2. R16 平衡点: 607.5 → 540 (PR, =432e12/(1.6e12/2)); DT: 547/2→243; 影响 MergeBatch 条件5 (AI < R16/b0) 与 b0 上限;
  3. StreamK θ_c: 12.24 → 10.9 (K 阈值: grid_K=32 时 396 → 360);
  4. ASW 面积/周长分界: 93.5 → 83.1 (sM·sN/(sM+sN) 阈值), MMAD/FIX 分界 K: 304 → 270 —— 个别边界 case 的主导项判定/尾轮策略可能翻转;
  5. examples 44 例的 t_mmad/t_total/瓶颈列预期普遍变化 (+12.5% 于 MMAD 主导行); 测试中新数值锁定;
  6. 文档更新: README / docs/00 / 04 / 05 / 07 (05 §1 硬件事实、07 分界常数、00 R16 公式、04 差异对照的 607.5 实例); BMM/BMM算子优化分析_Release/ 理论归档文档不动 (历史版本口径)。
## 用户裁决 issue#38 遗留的口径问题, 用户裁决: **使用 Cube 核应用的 Cube-only 口径** —— `cube_peak_tflops` 取白皮书表3-1 "Cube算力" 单行 (不含 Vector)。 ## 变更值 (白皮书表3-1) | SKU | 旧 (Cube+Vector 总) | 新 (Cube-only) | |---|---|---| | Ascend950PR (32核) | 486 | **432** | | Ascend950PR_C28 | 425 | **378** | | Ascend950DT (36核) | 547 | **486** | | Ascend950DT_C32 | 486 | **432** | | Ascend950DT_C28 | 425 | **378** | 单核 Cube BF16 全系列精确统一为 **13.5 TFLOPS** (= 16³ MAC/拍 × 1.65GHz; 432/32=378/28=486/36=13.5, 28 核档原 0.06% 取整偏差随之消失)。 ## 影响面 (预期, 数值均经 q16/q_cube/r16 派生自动传导, 无结构改动) 1. **MMAD 时延全量 +12.5%** (×486/432): t_mmad / drain / beats 阈值 T_comp / StreamK θ_c; 2. **R16 平衡点**: 607.5 → **540** (PR, =432e12/(1.6e12/2)); DT: 547/2→**243**; 影响 MergeBatch 条件5 (`AI < R16/b0`) 与 b0 上限; 3. **StreamK θ_c**: 12.24 → **10.9** (K 阈值: grid_K=32 时 396 → 360); 4. **ASW 面积/周长分界**: 93.5 → **83.1** (sM·sN/(sM+sN) 阈值), MMAD/FIX 分界 K: 304 → **270** —— 个别边界 case 的主导项判定/尾轮策略可能翻转; 5. examples 44 例的 t_mmad/t_total/瓶颈列预期普遍变化 (+12.5% 于 MMAD 主导行); 测试中新数值锁定; 6. 文档更新: README / docs/00 / 04 / 05 / 07 (05 §1 硬件事实、07 分界常数、00 R16 公式、04 差异对照的 607.5 实例); `BMM/BMM算子优化分析_Release/` 理论归档文档不动 (历史版本口径)。
admin closed this issue 2026-09-09 03:05:24 +00:00
Author
Owner

已按用户裁决完成切换并推送 (commit ec4fee9, Fix #40)。

落地

  • 5 个 SKU 全部切到 Cube-only: 950PR 486→432, 950PR_C28 425→378, 950DT 547→486, 950DT_C32 486→432, 950DT_C28 425→378; 单核 Cube BF16 全系列精确 13.5 TFLOPS (= 16³ MAC/拍 × 1.65GHz; 28 核档原 0.06% 取整偏差随之消失);
  • 无结构改动: 全部下游经 q16/q_cube/r16 派生自动传导。

影响面实测 (examples 44 例)

  • recommend 27/44 行变化: 计算 Bound 行 t_total 精确 +12.50% (asw_demo_full 565.6→636.3us, b8_m131072_n8192_k8192 289.6→325.8ms 等); 访存主导 17 行不变或微变 (drain 的 T_comp 分量 +0.03~0.3%);
  • 瓶颈翻转 1 例: b8_m32768_n2048_k512 MTE2→MMAD (+5.39%, MMAD 链 12.5% 上移越过 MTE2);
  • plans.csv 仅 1 处文案: merge_demo_k_trunc note 的 b0 算存比上限 23.7→21.1 (r16 607.5→540 派生), 方案结构不变;
  • 分支路由 0 翻转 (44 例)。

验证

  • 单测 88/88 通过 (TestIssue38 数值更新: q16=13.5e12 精确、R16 PR=540/DT=243/DT_C32=216; 既有边界 case 无一翻转 —— 锁定值与分界距离足够);
  • 压力回归 10000 例干净 (0 崩溃/NaN/违规/GM<V_in); 分支分布: MergeBatch 386→392, IterBatch 2389→2384, 其余不变 —— R16 下移使 b0 算存比上限收小, 个别边界 case 换边, 属预期物理后果;
  • 文档同步: README / docs/00 (R16=540) / 04 (bmmv3 607 常数对照说明) / 05 (硬件事实 432/13.5T + §6 复核算例 9.942us) / 06+07 (翻出阈值 (187/s)²→(166/s)², 分界 93.5→83.1, 304→270) / 05_StreamK (θ_c≈10.9, K 阈值 396→360, GM 落点 97→86); 理论归档 (BMM算子优化分析_Release/) 与 03_测评报告 历史快照保持不动。

闭环。issue#38 遗留的口径裁决至此全部落地。

已按用户裁决完成切换并推送 (commit ec4fee9, `Fix #40`)。 ## 落地 - **5 个 SKU 全部切到 Cube-only**: 950PR 486→432, 950PR_C28 425→378, 950DT 547→486, 950DT_C32 486→432, 950DT_C28 425→378; 单核 Cube BF16 全系列精确 **13.5 TFLOPS** (= 16³ MAC/拍 × 1.65GHz; 28 核档原 0.06% 取整偏差随之消失); - 无结构改动: 全部下游经 `q16`/`q_cube`/`r16` 派生自动传导。 ## 影响面实测 (examples 44 例) - **recommend 27/44 行变化**: 计算 Bound 行 t_total 精确 **+12.50%** (asw_demo_full 565.6→636.3us, b8_m131072_n8192_k8192 289.6→325.8ms 等); 访存主导 17 行不变或微变 (drain 的 T_comp 分量 +0.03~0.3%); - **瓶颈翻转 1 例**: b8_m32768_n2048_k512 MTE2→MMAD (+5.39%, MMAD 链 12.5% 上移越过 MTE2); - **plans.csv 仅 1 处文案**: merge_demo_k_trunc note 的 b0 算存比上限 23.7→21.1 (r16 607.5→540 派生), 方案结构不变; - **分支路由 0 翻转** (44 例)。 ## 验证 - 单测 **88/88** 通过 (TestIssue38 数值更新: q16=13.5e12 精确、R16 PR=540/DT=243/DT_C32=216; 既有边界 case 无一翻转 —— 锁定值与分界距离足够); - 压力回归 10000 例干净 (0 崩溃/NaN/违规/GM<V_in); 分支分布: MergeBatch 386→392, IterBatch 2389→2384, 其余不变 —— R16 下移使 b0 算存比上限收小, 个别边界 case 换边, 属预期物理后果; - 文档同步: README / docs/00 (R16=540) / 04 (bmmv3 607 常数对照说明) / 05 (硬件事实 432/13.5T + §6 复核算例 9.942us) / 06+07 (翻出阈值 (187/s)²→(166/s)², 分界 93.5→83.1, 304→270) / 05_StreamK (θ_c≈10.9, K 阈值 396→360, GM 落点 97→86); 理论归档 (BMM算子优化分析_Release/) 与 03_测评报告 历史快照保持不动。 闭环。issue#38 遗留的口径裁决至此全部落地。
Sign in to join this conversation.
No Label
1 Participants
Notifications
Due Date
No due date set.
Dependencies

No dependencies set.

Reference: admin/matmul-analysis#40
No description provided.