一个架构改动让 KV 缓存缩小 8 倍:GQA 原理与 Llama 3 实例拆解

blaizedsouza · x · 2026-09-14

作者以 Llama 3 70B 为例解释分组查询注意力(GQA)如何大幅削减 KV cache:标准多头注意力中每个 query head 都有独立 KV head,64 个 query head 就要存 64 套 KV 向量;Multi-Query Attention 全部共享一个 KV head,缓存最小但伤模型质量;GQA 折中——Llama 3 70B 每 8 个 query head 共享一个 KV head,只存 8 套 KV,这部分缓存缩小 8 倍,解码时的 KV 读取量也同比例下降。

原推同时链接了一篇长文《KV Cache Engineering for LLM Serving》,系统讲解 KV cache 为何增长、12 种模型与服务引擎侧的削减手段、各自实际节省什么以及取舍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →