矩阵乘法优化上限:数据移动而非乘法次数

yaroslavvb · x · 2026-08-19

讨论了矩阵乘法(matmul)性能优化的瓶颈。指出PRAM模型已过时,因为数据无法在单时钟周期内从芯片一端传到另一端。如果参考arxiv 2205.04934建模线延迟,matmul的下界是已知的,且由脉动阵列(systolic array)实现。现代计算机中matmul性能主要由数据移动成本而非乘法数量决定。

所属事件:矩阵乘法性能瓶颈在数据移动而非乘法次数(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →