KV 缓存引入虚拟内存:kvcached 已部署超万卡 GPU
techNmak · x · 2026-09-25
开发者 techNmak 介绍 GitHub 开源项目 kvcached:把操作系统里最古老的虚拟内存思想应用到 LLM 推理服务最大的瓶颈之一——KV 缓存的 GPU 显存分配上。
问题:vLLM 和 SGLang 可以为每个模型预留大块 KV 缓存池,PagedAttention 已能在模型内部高效管理这些分页块,但物理 GPU 显存仍难以在多个模型实例之间重新分配。
方案:kvcached 将虚拟 KV 地址空间与底层物理 GPU 显存解耦。模型可以预留很大的虚拟空间,而物理显存页只在需求增长时按需映射,随后还能被回收并复用给其他模型。
背景:其底层 Prism 系统发表于 OSDI ’26,kvcached 的 balloon driver 已在超过 1 万块 GPU 上部署。对从事 LLM 推理工作的人值得深入研究。
「Infra」频道最新
- 前 Intel CEO 称「HBM 很糟糕」,高带宽闪存 HBF 呼之欲出 — Glittering_Depth_722 · 2026-09-25
- MLPerf v6.1 推出首个 LLM 后训练基准:397B 模型跑智能体 RL 修软件 — TheKanter · 2026-09-25
- 作者重返 IEEE 演讲:从芯片到模型全栈微优化以小博大 — fooobar · 2026-09-25
- 开发者自建 AI 获客工作流,断言下时代入口属 OS 级硬件 — dotey · 2026-09-25
- WSJ:AI 关键内存芯片价格飙升令美国陷入两难 — pstAsiatech · 2026-09-25
- 实测:Qwen Flash Next IQ4_XS 四项基准全面胜过 27B FP8 — smallDeltaBigEffect · 2026-09-25