本地频繁换模型不用丢缓存:SGLang hicache 三层 KV 缓存实战
TheZachMueller · x · 2026-09-22
作者解析本地部署时 KV 缓存的管理问题:通常重启服务或切换模型后缓存即被销毁,切回旧模型时它的缓存也没了,只能重新计算所有 prompt。SGLang 支持通过配置参数启用 hicache 三层缓存:
- L1:GPU KV 缓存
- L2:RAM KV 缓存(容量更大)
- L3:持久化存储层
关键结论:如果你经常在本地热切换模型,配置 L3 存储缓存可以让旧模型的缓存持久保留,切回时无需重算 prompt,显著提升推理效率。
「Infra」频道最新
- AMD 工程师受 gemm ladder 启发发布 GEMM 优化教程博客 — simran_s_arora · 2026-09-22
- 网友称 Meta 未在 WhatsApp 推 Muse 因硬件撑不起 20 亿用户 — zephyr_z9 · 2026-09-22
- Terraform 沙漠试验场实现太阳能直驱量产高纯甲醇与 99.9% 氢气 — GabGarrett · 2026-09-22
- 从朴素实现到共享内存分块:一篇 CUDA GEMM 提速实战全记录 — abhijithneil · 2026-09-22
- AMD 发布 Helios GPU 教学 GEMM 调优指南:432GB HBM4、23TB/s 带宽实测 — simran_s_arora · 2026-09-22
- 能力涨价的另一面:Grok 4.7 每任务消耗 81k token,超对手两倍 — ArtificialAnlys · 2026-09-22