FlashAttention 揭示:只看 FLOPs 判断 GPU 性能有多误导
techNmak · x · 2026-09-10
作者以 FlashAttention 为例,说明仅用 FLOPs 衡量 GPU 性能的缺陷。标准稠密 attention 的计算(QK^T、softmax、乘 V)本身高度并行,算术强度并不低;真正的瓶颈在于朴素实现会物化巨大的 N×N 中间矩阵,频繁写入和读取高带宽显存。
FlashAttention 的核心贡献正是围绕这些内存访问做优化:通过分块(tiling)与在线 softmax,把中间结果留在片上 SRAM,避免 HBM 往返,从而大幅提升实际吞吐。这篇文章是理解『attention 是内存受限而非计算受限』的绝佳案例。
所属事件:FlashAttention 进化全解:省 HBM 流量比堆算力更关键(2 条相关)→
「Infra」频道最新
- Positron AI 融资 2.3 亿美元估值破十亿,Arm 参投 — seanmcdonaldxyz · 2026-09-11
- 推理提速改变 Agent 工作流:Cerebras 实测并行代理更少、产出不降 — MatthewBerman · 2026-09-11
- Baseten 收购 Blaxel,押注下一代智能体基础设施 — baseten · 2026-09-11
- 超大规模厂商有能力分解 RSA-1024,单个成本约 3000 万美元 — rickasaurus · 2026-09-11
- 高通新 Hexagon NPU:共享内存增大 50%,手机可跑 30B MoE 模型 — ryanshrout · 2026-09-11
- Vercel CDN 每秒 8000 万次路由决策,P99 延迟砍掉 91% — cramforce · 2026-09-11