vLLM 推出分层 KV Cache 卸载框架,跨内存与对象存储扩展推理容量

vLLM Blog · rss · 2026-09-10

vLLM 博客介绍了 Tiered KV Cache Offloading:一个以主机为中心的框架,把 KV Cache 分层卸载到主机内存、文件系统、对象存储和远程节点上。

对部署长上下文/高并发推理服务的团队是值得关注的基础设施进展。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →