KV 缓存引入虚拟内存:kvcached 已部署超万卡 GPU

techNmak · x · 2026-09-25

开发者 techNmak 介绍 GitHub 开源项目 kvcached:把操作系统里最古老的虚拟内存思想应用到 LLM 推理服务最大的瓶颈之一——KV 缓存的 GPU 显存分配上。

问题:vLLM 和 SGLang 可以为每个模型预留大块 KV 缓存池,PagedAttention 已能在模型内部高效管理这些分页块,但物理 GPU 显存仍难以在多个模型实例之间重新分配。

方案:kvcached 将虚拟 KV 地址空间与底层物理 GPU 显存解耦。模型可以预留很大的虚拟空间,而物理显存页只在需求增长时按需映射,随后还能被回收并复用给其他模型。

背景:其底层 Prism 系统发表于 OSDI ’26,kvcached 的 balloon driver 已在超过 1 万块 GPU 上部署。对从事 LLM 推理工作的人值得深入研究。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →