从第一性原理吃透 KV Cache:一份覆盖 MHA/GQA/MLA 到 PagedAttention 的技术手册
techNmak · x · 2026-09-06
推主整理了一份关于 LLM 推理中 KV cache 的技术手册,从第一性原理讲起:
- 基础机制:自回归生成时,若不缓存,每个解码步都要重算已处理 token 的 key/value 状态;KV cache 通过存储并复用这些张量避免冗余计算。
- 全局影响:cache 随序列长度增长、占用大量 GPU 显存、在解码阶段造成显存带宽压力——这解释了架构从 MHA 演进到 MQA/GQA 的原因、MLA 为何采用不同的压缩路线,以及 PagedAttention 等系统为何出现。
- 手册覆盖:具体缓存了什么、张量形状、显存占用公式、MHA/GQA/MQA 的具体计算、prefill vs decode、MLA、PagedAttention、前缀复用、offloading、量化、逐出策略及常见误解。
内容基于原始论文和当前框架文档写成。
「Infra」频道最新
- 近乎一本书的虚拟内存长文:页表、TLB、NUMA 与性能优化全拆解 — abhi9u · 2026-09-06
- Qwen3.8 Flash 本地实测:M4 Max 跑 45 tok/s 接近 27B 速度 — DerTomsn · 2026-09-06
- Altman 算账:3.8 万次 ChatGPT 查询才耗水一颗加州杏仁 — victor_explore · 2026-09-06
- 双 GB10 桌面级方案,称可跑当前最强本地模型 — jasonkneen · 2026-09-06
- Reddit 用户实测:一个节点让 MiniMax H3 在 5090 上告别 OOM — denizbuyukayak · 2026-09-06
- Agent 时代 KV cache 挤爆 HBM,容量不足拖垮有效带宽 — AccBalanced · 2026-09-06