本地频繁换模型不用丢缓存:SGLang hicache 三层 KV 缓存实战

TheZachMueller · x · 2026-09-22

作者解析本地部署时 KV 缓存的管理问题:通常重启服务或切换模型后缓存即被销毁,切回旧模型时它的缓存也没了,只能重新计算所有 prompt。SGLang 支持通过配置参数启用 hicache 三层缓存:

关键结论:如果你经常在本地热切换模型,配置 L3 存储缓存可以让旧模型的缓存持久保留,切回时无需重算 prompt,显著提升推理效率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →