FlashAttention 揭示:只看 FLOPs 判断 GPU 性能有多误导

techNmak · x · 2026-09-10

作者以 FlashAttention 为例,说明仅用 FLOPs 衡量 GPU 性能的缺陷。标准稠密 attention 的计算(QK^T、softmax、乘 V)本身高度并行,算术强度并不低;真正的瓶颈在于朴素实现会物化巨大的 N×N 中间矩阵,频繁写入和读取高带宽显存。

FlashAttention 的核心贡献正是围绕这些内存访问做优化:通过分块(tiling)与在线 softmax,把中间结果留在片上 SRAM,避免 HBM 往返,从而大幅提升实际吞吐。这篇文章是理解『attention 是内存受限而非计算受限』的绝佳案例。

所属事件:FlashAttention 进化全解:省 HBM 流量比堆算力更关键(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →