一个架构改动让 KV 缓存缩小 8 倍:GQA 原理与 Llama 3 实例拆解
blaizedsouza · x · 2026-09-14
作者以 Llama 3 70B 为例解释分组查询注意力(GQA)如何大幅削减 KV cache:标准多头注意力中每个 query head 都有独立 KV head,64 个 query head 就要存 64 套 KV 向量;Multi-Query Attention 全部共享一个 KV head,缓存最小但伤模型质量;GQA 折中——Llama 3 70B 每 8 个 query head 共享一个 KV head,只存 8 套 KV,这部分缓存缩小 8 倍,解码时的 KV 读取量也同比例下降。
原推同时链接了一篇长文《KV Cache Engineering for LLM Serving》,系统讲解 KV cache 为何增长、12 种模型与服务引擎侧的削减手段、各自实际节省什么以及取舍。
「Infra」频道最新
- llama.cpp 合入 Maple 20B-A1B 三值 MoE,CPU 低显存跑新模型 — jacek2023 · 2026-09-14
- Claude 用量加成取消,「算力大紧缺」或已开始 — jacob_posel · 2026-09-14
- 八万亿美元数据中心豪赌遭工会抵制:暂停新建直到工人权益受保护 — nordicinst · 2026-09-14
- SK 海力士完成 HBM4 内部认证,HBM 进入定制基底裸片竞争时代 — blaizedsouza · 2026-09-14
- HBM 系统架构全景:从 DDR 演化到 GDDR7、PIM 与 HBF 等替代路线 — blaizedsouza · 2026-09-14
- Nvidia 新论文:让 LLM 稀疏化提速,95% 静默神经元可被跳过 — YesThisIsLion · 2026-09-14