Meta 开源 Suffix Cache Reuse,编辑轮缓存命中率大幅提升
Meta 研究团队(Rulin Shao 等)基于 SGLang 开源了混合注意力(全注意力与线性注意力交错)模型的后缀缓存复用(SCR)补丁,用于高效服务上下文语言模型。数据显示在编辑轮中缓存命中率可从 29.9% 提升至 58.1%,显著改善 KV cache 复用效率,实现细节与命中拆解分析也一并公开。
2026-10-02 ~ 2026-10-02 · 2 条相关
- 混合注意力后缀缓存复用:编辑轮命中率 29.9% 提回 58.1% — RulinShao · 2026-10-02
- Meta 开源 Suffix Cache Reuse:上下文编辑时 KV cache 复用率大幅提升 — RulinShao · 2026-10-02