从 GPU 显存瓶颈下手,Tri Dao 的 FlashAttention 如何成为大模型标配
thisdudelikesAI · x · 2026-10-01
- 起点:2022 年 Stanford 博士生 Tri Dao 与 Chris Ré、Stefano Ermon 等人发布 FlashAttention,数月内被全球头部 AI 实验室采用,如今几乎内嵌于所有主流大模型。
- 核心洞察:Transformer 的瓶颈不在 attention 的数学近似,而在 GPU 显存带宽——大量时间耗在主存与片上高速缓存之间的数据搬运。FlashAttention 是精确算法、不做近似,快 2–4 倍、省 10–20 倍内存,使同成本下可训练更长上下文。
- 后续:PyTorch、Hugging Face 迅速集成;2023 年 7 月发布重写的 FlashAttention-2(再快约 2 倍)并出任 Together AI 首席科学家;同年 12 月与 Albert Gu 发布挑战 Transformer 的 Mamba,虽被 ICLR 2024 拒稿却成为年度最具影响力架构论文之一;此后又有面向 Hopper 的 FlashAttention-3 及逐代芯片适配。
- 现状:Dao 现为 Princeton 助理教授兼 Together AI 首席科学家,仍亲手写 GPU kernel。作者点题:许多最大突破并不在发布会上,而藏在关注显存带宽的代码里。
「Infra」频道最新
- 传 Anthropic 将向 Broadcom 采购约 5GW 算力,2027 年或成其最大客户 — zephyr_z9 · 2026-10-01
- 本地秒出录音棚级配音:9900万参数开源TTS跑赢ElevenLabs — JafarNajafov · 2026-10-01
- Zoho 自建云十余年后开放:Catalyst 免费供学生构建部署应用 — RoboBalaji · 2026-10-01
- 双显卡跑 vLLM 50+40 系列:作者开源踩坑后的资源配置 — Fz1zz · 2026-10-01
- Diffusers 张量并行加载升级:Flux.2-Dev 加载提速 2.4 倍 — RisingSayak · 2026-10-01
- RTX 6000 集群散热实战:出风口对墙、Pro 卡反转避吹主板 — TheZachMueller · 2026-10-01