从 KV 缓存本质讲透 MHA/MQA/GQA/MLA 四种注意力变体的区别

techNmak · x · 2026-09-13

一篇从第一性原理梳理注意力架构的长文,核心观点:MHA、MQA、GQA、MLA 的真正区别不在「头的数量」,而在解码时 key/value 状态如何存储。

配套的技术手册覆盖:单头注意力、KV-cache 公式、decode 带宽、GQA uptraining、MLA 潜空间压缩与投影吸收、解耦 RoPE、缓存对比算例、FlashAttention 与 PagedAttention、实现细节与常见误区,均以原始论文和框架文档为依据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →