Meta 开源 Suffix Cache Reuse,编辑轮缓存命中率大幅提升

Meta 研究团队(Rulin Shao 等)基于 SGLang 开源了混合注意力(全注意力与线性注意力交错)模型的后缀缓存复用(SCR)补丁,用于高效服务上下文语言模型。数据显示在编辑轮中缓存命中率可从 29.9% 提升至 58.1%,显著改善 KV cache 复用效率,实现细节与命中拆解分析也一并公开。

2026-10-02 ~ 2026-10-02 · 2 条相关