docs: 新增 06_落地验证计划_理论方案_vs_bmmv3源码.md
理论方案落地 batch_mat_mul_v3 真实算子源码(arch35/Ascend950PR)的 比对分析与上板验证计划: - 源码现状架构梳理(host 策略注册表静态优先级/kernel 7 参模板分发/ 平台带宽算力公式与理论口径天然对齐) - 五分支逐项比对(StreamK/ASW 尾轮/IterBatch 形态/MergeBatch 准入仲裁/ 转Matmul特殊广播), 每项含差异清单+host/kernel 修改重点+ 预期时延变化(理论模型测算数字)+验证重点 - 收益排序: StreamK 准入放宽(定向 case -73%~-82%, host-only) > ASW 尾轮重切(-25%~-43%, 方案B host-only) > MergeBatch 准入补齐 (防误捕获) > IterBatch 形态补全(kernel 重写, 收益待 T_cmd 标定) - 上板验证方案(三层 case 集/标定项/通过标准)与分批 PR 计划 README 文档树补登 04/06 两篇。
This commit is contained in:
@@ -94,7 +94,9 @@ BMM_Theory/
|
||||
│ │ ├── 06_ASW_Basic分支.md # 尾轮策略已内化为其必要环节
|
||||
│ │ └── 07_尾轮处理策略.md # 尾轮完整推导 (参考)
|
||||
│ └── 03_测评报告/ # 外部测评报告 (v1.0/v2.0 及后续复评)
|
||||
│ └── 05_L2驻留GM读写与dtype算力口径_设计分析.md # GM/L2/输出落点/dtype算力统一口径 (issue#27-#30)
|
||||
│ ├── 04_差异对照_bmmv3_vs_BMM_Theory.md # bmmv3 行为预测器 vs 理论推导器对照
|
||||
│ ├── 05_L2驻留GM读写与dtype算力口径_设计分析.md # GM/L2/输出落点/dtype算力统一口径 (issue#27-#30)
|
||||
│ └── 06_落地验证计划_理论方案_vs_bmmv3源码.md # 理论落地 bmmv3 源码的比对/修改/上板验证计划
|
||||
├── examples/ # 示例输入输出
|
||||
└── tests/ # 单元测试 (固化文档边界 case + issue 回归)
|
||||
```
|
||||
|
||||
Reference in New Issue
Block a user