13 种注意力机制一文讲透:按瓶颈分类,从 MHA 到 FlashAttention
blaizedsouza · x · 2026-09-13
Akash(@akshaypachaar)整理了 AI 工程师必须知道的 13 种注意力机制,核心思路是:这些技术常被混在一起谈,其实各自解决不同瓶颈,按瓶颈分类更清晰。
分类框架:
- KV cache 太大 → MHA(最大灵活性、最大缓存)、MQA(所有查询头共享一个 KV 头)、GQA(分组共享,折中方案)
- 其余机制涵盖控制哪些 token 可以互相 attend、让 attention 计算更便宜(FlashAttention、Sparse attention)、以及 serving 时的 KV cache 管理(PagedAttention、RadixAttention)
原文配图详解 Self-attention、Cross-attention、Multi-Head Attention 等机制,适合当作速查手册收藏。
「Infra」频道最新
- AirLLM 逐层流式加载:4GB 显存跑 70B 模型,2.8T Kimi K3 不到 4GB — alex_verem · 2026-09-14
- 开源项目 JAX-QNN:让 JAX 原生跑在高通骁龙 AI 引擎上 — carrycooldude · 2026-09-14
- 内存已占 AI 加速器成本 63%,五十年行业优先级被逆转 — Summit-Star001 · 2026-09-14
- Ollama 联合创始人:小模型已能胜任大多数对话与推理场景 — ollama · 2026-09-14
- FCC新规未将光模块列入黑名单,中际旭创当日大涨4% — pstAsiatech · 2026-09-14
- 西安团队突破铁电存储寿命100倍,写入超百亿次登上Science — pstAsiatech · 2026-09-14