补全昇腾950系列硬件规格: 新增 Ascend950DT (36/32/28核) 与 950PR 28核 SKU, 默认加载不变 #38
Reference in New Issue
Block a user
No description provided.
Delete Branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
需求
bmm_theory/hardware/目前只有 Ascend950PR 32 核主 bin (NpuSpec 默认值)。补全系列其他版本规格, 重点 Ascend950DT; 保证现有硬件参数的加载调用不受影响。数据来源
\\HwFs\HW_WorkBuddy\昇腾NPU\昇腾NPU知识库\00_硬件\昇腾950_NPU架构白皮书表3-1 (系列 SKU 规格) + 表4-2 (Memory 层次) + 昇腾产品形态说明 (950PR→Atlas 350 加速卡; 950DT→Atlas 850E/650E/950 SuperPoD)。SKU 矩阵 (白皮书表3-1)
关键结论
⚠️ 口径偏差发现 (待用户裁决, 本 issue 不改任何现有行为)
白皮书表3-1 "Cube算力"单行: PR32 Cube BF16 = 432 TFLOPS; 486 为 Cube+Vector 总算力 (432+54; 单核 13.5T)。现行
NpuSpec.cube_peak_tflops=486沿用 v0.98/用户澄清口径把 486 当 Cube 峰值 (单核 15.1875T), 比白皮书 Cube 单行高 12.5%, 即全模型 MMAD 时延可能整体偏低 12.5%。本 issue 为保 0 diff 沿用现行口径 (新增 DT 各档同口径: 547/486/425, 单核 15.1875T 全系列一致, 代码注释标明出处与偏差)。是否把全模型切换到白皮书 Cube-only 口径 (PR32→432 / DT36→486, 全量 MMAD 时延 +12.5%, examples/测试全变) 请用户裁决; 若切换另行开 issue 专项处理。
改动内容
ascend950pr.py: 新增gm_capacity_gb信息字段 (模型暂不消费) +ASCEND950PR_C28实例;ascend950dt.py:ASCEND950DT(36 核主 bin) /ASCEND950DT_C32/ASCEND950DT_C28;__init__.py:SPECS注册表 +get_spec(name), 默认仍为 ASCEND950PR, 现有from .hardware import NpuSpec, ASCEND950PR调用点零改动;docs/01_软件架构.md+README.md更新硬件层说明;tests/test_branches.py新增 TestIssue38 锁定: 默认规格不变、5 SKU 注册表、DT 派生量 (bw_pc/r16/AIV 白皮书交叉验证)、DT router 冒烟、未知名 KeyError。已完成并推送 (commit
8d42d95,Fix #38)。落地内容
bmm_theory/hardware/ascend950dt.py(新增): 三个 SKU 实例 ——ASCEND950DT(主 bin): 36 AIC / 72 AIV, Cube+Vector BF16 547 TFLOPS, HBM 4TB/s / 144GB, L2 128MB;ASCEND950DT_C32: 32/64, 486 TFLOPS, 4TB/s (容量映射 144GB 待确认);ASCEND950DT_C28: 28/56, 425 TFLOPS, 4TB/s, 96GB。ascend950pr.py: 新增ASCEND950PR_C28(28/56, 425 TFLOPS, 1.4TB/s, 112GB, L2 112MB); 新增gm_capacity_gb信息字段 (模型暂不消费); 字段注释标明算力口径 (= 白皮书 "Cube+Vector 总算力" 行) 及与 "Cube 单行 432" 的 12.5% 偏差 (待用户裁决, 见下)。hardware/__init__.py:SPECS注册表 +get_spec(name); 默认导出不变 (from .hardware import NpuSpec, ASCEND950PR全部现有调用点零改动)。docs/01_软件架构.md§3.3/扩展指南 +README.md目录结构更新为多 SKU 说明。共架构交叉验证 (白皮书自洽)
aiv_freq_ghz=1.65 / aiv_fp32_per_cycle=128一致;验证
遗留待裁决 (不影响本 issue 闭环)
白皮书表3-1 "Cube算力" 单行为 Cube 单元独立口径 (PR32=432, 单核 13.5T), 现行
cube_peak_tflops=486实为 Cube+Vector 总算力口径 (单核 15.1875T) —— 全模型 MMAD 时延相对 Cube-only 口径可能整体偏低 12.5%。是否切换需用户裁决; 若切换将单独开 issue (examples/测试全量重算)。闭环。