2026-03-08 - 2026-09-08
Overview
36 Issues closed from 1 user
Closed
#36 MergeBatch 合并搬移效率收益建模 (tile=nValue*dValue*dt 放大 b0 倍) + t_cmd_ns 置 0
Closed
#35 MergeBatch L1 绑定情形 DMA 命令数多计 b0 倍, 且 beats_iterbatch 截断判定与方案口径不一致
Closed
#34 34. ASW_Basic 兜底必须恒出方案: 搬移效率下限不满足应降级标注(warning), 不是违规/不可行
Closed
#33 33. ASW_Basic tile 选择僵化恒为176: BaseM/N 应用 L0C 单缓冲方形256, SingleCoreM/N 应用 v1.91 §5.2 有界枚举最小搬入
Closed
#32 32. ASW 场景C GM 超输入成倍放大: 未识别单侧全驻留调度+分组非最小替换, 且06文档已漂移需同步
Closed
#31 31. IterBatch/MergeBatch GM 读取量超输入总量: K切分按整段上取+驻留侧重复计, 应每字节恰读一次=V_in
Closed
#29 29. GM读取量<输入数据量(列口径)+缺L2驻留工作集统一模型: 先设计文档后代码
Closed
#30 30. Fixpipe输出落点: 默认写L2, 整case容量不足才直写GM(输入优先驻留)
Closed
#28 28. 时延估算未按输入dtype取算力: Cube恒用BF16/AIV恒用fp32, 需dtype感知速率表
Closed
#27 27. MergeBatch Cube 时延公式复核: 与建议公式一致(附证明), 字节列口径随#29统一
Closed
#26 [P3] 降核/低核数带宽线性假设需标注待标定(min_core_num=0.8C 处 90%+ 带宽利用率的 KB 锚点)
Closed
#23 [P1] GM 读写共享总线未建模:MTE2 读与 Fixpipe 直写 GM 并发时需按 (读+写)/1.6TB/s 累加计时
Closed
#24 [P1] 切M/N(ASW) 的共享块重复读未按 L2 带宽计时;场景判定与分组预算 D 错误除以总 batch 数
Closed
#25 [P2] StreamK evaluate 使用假想 65536 元素 L0C 方形 tile,未按 plan 实际 single_core_m×n 计量(瘦长 case 搬入低估 ~16x)
Closed
#20 [P3] #13/#15 的回归测试在第三轮被删除(修复代码仍在,失去保护)
Closed
#21 [P3] 仓库卫生复发:9 个调试临时 csv 再次被提交入库(bug1*.csv/t*.csv/p2.csv),.gitignore 未覆盖
Closed
#22 [P3] 文档与代码状态失同步:04_差异对照 版本声明称"含 issue#11-#16 修复"与回退后的代码矛盾
Closed
#17 [P1] 第三轮整改回退了 #11/#12/#14 的修复:StreamK fixpipe 双重计账(55us)、K=1 空洞(49.4%)、advice 误导,需恢复或给出替代论证
Closed
#18 [P2] 占位方案(used_core_num=0)可被 evaluate 判为可行并给出正常时延:recommend"无方案"与 evaluate"可行"矛盾
Closed
#19 [P3] 转置感知 dValue 建模当前不生效:c/d 生成守卫与条件4/约束器口径不一,且新增转置测试全部空转
Closed
#13 [P3] MergeBatch 极端瘦长 case 推荐不可行:b0 选择未纳入 L0A/L0B 容量上限(8000 例中 16 例,0.2%)
Closed
#14 [P3] FIXPIPE 瓶颈建议对 StreamK 误导:fp16/fp8 减半提示与部分和 4B 规则矛盾
Closed
#15 [P3] 输入校验缺失:负/零矩阵维度静默产出伪方案
Closed
#16 [P3] 工程噪音:缺 .gitignore(整改期 11 个 commit 误提交临时 csv)、router._wrap 死代码、README 目录树缺 03_测评报告
Closed
#11 [P2] StreamK fixpipe 部分和写双重计账且按单核串行高估约 32 倍(issue#9 修复引入的新口径问题)
Closed
#12 [P3] K=1 且 batch<128 仍无理论方案:AIV 单缓冲场景缺失(现仅占位标注"无方案")
Closed
#7 [P2] io_csv 未解析 out_nd 列:StreamK 工程约束(输出需 ND)在 CLI 层不可表达
Closed
#8 [P2] A/B 输入 dtype 不一致时无告警:models.py 注释承诺的 warning 未实现
Closed
#9 [P2] StreamK 时延计账口径疑点:REDUCE 同时计入稳态 max() 与 drain;fixpipe 按 C dtype 与"部分和 4B"口径不一致
Closed
#10 [P3] 文档-代码漂移:README 与 docs/01_软件架构.md 仍描述"本期 MergeBatch+IterBatch、asw_basic/stream_k 待迭代"
Closed
#5 [P1] 推荐模式不做约束自检:大量推荐方案被本工具自带评估器判为不可行(随机 6%~18%)
Closed
#6 [P1] dValue 下限约束口径矛盾:IterBatch 形态 a/b"恒满足"与评估器 k_L1*dtype>=128B 检查冲突
Closed
#4 [P0] K=1 且 batch<128 的 case 在 recommend 中崩溃(AttributeError: NoneType used_core_num)
Closed
#1 Batch Matmul算子特性分析_v0.1
Closed
#2 Batch Matmul算子特性分析_v0.2
Closed
#3 BMM算子优化分析_v0.3
36 Issues created by 0 users
Opened
#1 Batch Matmul算子特性分析_v0.1
Opened
#2 Batch Matmul算子特性分析_v0.2
Opened
#3 BMM算子优化分析_v0.3
Opened
#4 [P0] K=1 且 batch<128 的 case 在 recommend 中崩溃(AttributeError: NoneType used_core_num)
Opened
#5 [P1] 推荐模式不做约束自检:大量推荐方案被本工具自带评估器判为不可行(随机 6%~18%)
Opened
#6 [P1] dValue 下限约束口径矛盾:IterBatch 形态 a/b"恒满足"与评估器 k_L1*dtype>=128B 检查冲突
Opened
#7 [P2] io_csv 未解析 out_nd 列:StreamK 工程约束(输出需 ND)在 CLI 层不可表达
Opened
#8 [P2] A/B 输入 dtype 不一致时无告警:models.py 注释承诺的 warning 未实现
Opened
#9 [P2] StreamK 时延计账口径疑点:REDUCE 同时计入稳态 max() 与 drain;fixpipe 按 C dtype 与"部分和 4B"口径不一致
Opened
#10 [P3] 文档-代码漂移:README 与 docs/01_软件架构.md 仍描述"本期 MergeBatch+IterBatch、asw_basic/stream_k 待迭代"
Opened
#11 [P2] StreamK fixpipe 部分和写双重计账且按单核串行高估约 32 倍(issue#9 修复引入的新口径问题)
Opened
#12 [P3] K=1 且 batch<128 仍无理论方案:AIV 单缓冲场景缺失(现仅占位标注"无方案")
Opened
#13 [P3] MergeBatch 极端瘦长 case 推荐不可行:b0 选择未纳入 L0A/L0B 容量上限(8000 例中 16 例,0.2%)
Opened
#14 [P3] FIXPIPE 瓶颈建议对 StreamK 误导:fp16/fp8 减半提示与部分和 4B 规则矛盾
Opened
#15 [P3] 输入校验缺失:负/零矩阵维度静默产出伪方案
Opened
#16 [P3] 工程噪音:缺 .gitignore(整改期 11 个 commit 误提交临时 csv)、router._wrap 死代码、README 目录树缺 03_测评报告
Opened
#17 [P1] 第三轮整改回退了 #11/#12/#14 的修复:StreamK fixpipe 双重计账(55us)、K=1 空洞(49.4%)、advice 误导,需恢复或给出替代论证
Opened
#18 [P2] 占位方案(used_core_num=0)可被 evaluate 判为可行并给出正常时延:recommend"无方案"与 evaluate"可行"矛盾
Opened
#19 [P3] 转置感知 dValue 建模当前不生效:c/d 生成守卫与条件4/约束器口径不一,且新增转置测试全部空转
Opened
#20 [P3] #13/#15 的回归测试在第三轮被删除(修复代码仍在,失去保护)
Opened
#21 [P3] 仓库卫生复发:9 个调试临时 csv 再次被提交入库(bug1*.csv/t*.csv/p2.csv),.gitignore 未覆盖
Opened
#22 [P3] 文档与代码状态失同步:04_差异对照 版本声明称"含 issue#11-#16 修复"与回退后的代码矛盾
Opened
#23 [P1] GM 读写共享总线未建模:MTE2 读与 Fixpipe 直写 GM 并发时需按 (读+写)/1.6TB/s 累加计时
Opened
#24 [P1] 切M/N(ASW) 的共享块重复读未按 L2 带宽计时;场景判定与分组预算 D 错误除以总 batch 数
Opened
#25 [P2] StreamK evaluate 使用假想 65536 元素 L0C 方形 tile,未按 plan 实际 single_core_m×n 计量(瘦长 case 搬入低估 ~16x)
Opened
#26 [P3] 降核/低核数带宽线性假设需标注待标定(min_core_num=0.8C 处 90%+ 带宽利用率的 KB 锚点)
Opened
#27 27. MergeBatch Cube 时延公式复核: 与建议公式一致(附证明), 字节列口径随#29统一
Opened
#28 28. 时延估算未按输入dtype取算力: Cube恒用BF16/AIV恒用fp32, 需dtype感知速率表
Opened
#29 29. GM读取量<输入数据量(列口径)+缺L2驻留工作集统一模型: 先设计文档后代码
Opened
#30 30. Fixpipe输出落点: 默认写L2, 整case容量不足才直写GM(输入优先驻留)
Opened
#31 31. IterBatch/MergeBatch GM 读取量超输入总量: K切分按整段上取+驻留侧重复计, 应每字节恰读一次=V_in
Opened
#32 32. ASW 场景C GM 超输入成倍放大: 未识别单侧全驻留调度+分组非最小替换, 且06文档已漂移需同步
Opened
#33 33. ASW_Basic tile 选择僵化恒为176: BaseM/N 应用 L0C 单缓冲方形256, SingleCoreM/N 应用 v1.91 §5.2 有界枚举最小搬入
Opened
#34 34. ASW_Basic 兜底必须恒出方案: 搬移效率下限不满足应降级标注(warning), 不是违规/不可行
Opened
#35 MergeBatch L1 绑定情形 DMA 命令数多计 b0 倍, 且 beats_iterbatch 截断判定与方案口径不一致
Opened
#36 MergeBatch 合并搬移效率收益建模 (tile=nValue*dValue*dt 放大 b0 倍) + t_cmd_ns 置 0