KV 缓存何止是加速器:大规模 LLM 推理里它已成存储系统
blaizedsouza · x · 2026-09-10
Avi Chawla 的长文解释了生产环境中 LLM 的 KV 缓存问题(也是高频面试题):
- 注意力层在处理 prompt 时生成 KV 张量,生成阶段直接读取该状态,避免每个新 token 重算整段序列;单请求内它只是临时 GPU 数据。
- 但当多个请求、多个推理 worker 复用相同 prompt 前缀时,缓存必须能在原请求结束后继续存在,甚至要在创建它的推理引擎重启后仍可用。
- 因此一次缓存命中不只是匹配 token,还涉及:定位相关 block、搬回 GPU 显存、存储满时淘汰旧 block、让多个 worker 共享同一份数据——KV cache 实质上变成了一套存储系统。
- 文章从第一性原理讲清 KV、Prefix、Prompt、Semantic 四层缓存的取舍,并配套开源项目 LMCache(GitHub 约 11.7k star),用于给 LLM 加最快的 KV 缓存层。
「Infra」频道最新
- turbovec 用 Rust 把 1000 万向量塞进 4GB 内存,检索还快过 FAISS — tom_doerr · 2026-09-10
- LM Studio 0.4.24 发布:支持高级 llama.cpp 参数覆盖与多项修复 — solyarisoftware · 2026-09-10
- tszzl 补充论证:算法效率提升只会放大对硬件的渴望 — tszzl · 2026-09-10
- 裁剪 MTP 草稿词表至 47k,DGX Spark 上解码提速 21.5% — MaziyarPanahi · 2026-09-10
- 5t/s 的本地模型算能用吗?Reddit 网友实测 27B 模型 — Zombiecidialfreak · 2026-09-10
- 投机解码深度博客预告:算术强度、 drafter 训练与 vLLM 部署 — auto_grad_ · 2026-09-10