Meta 开源 Suffix Cache Reuse:上下文编辑时 KV cache 复用率大幅提升

RulinShao · x · 2026-10-02

Meta 研究团队(Rulin Shao 等)开源了 Suffix Cache Reuse(SCR)的 SGLang 补丁,用于高效服务 context language model(CLM)。核心问题:CLM 会编辑自己的上下文,改动发生在 prompt 中间而非末尾,标准前缀缓存只要遇到第一个不匹配就需重新 prefill 之后所有 token。SCR 的做法是:当片段 B 被替换为 B′ 时,复用所有幸存 token(包括其后缀 C)的缓存状态,只对新插入/追加的 token 重新 prefill;幸存后缀带着旧前缀编码的 stale cache 反而可能保留更丰富的历史信息。附带材料包括:基于混合注意力(全注意力+线性注意力交错)的实现细节、CLM 上下文编辑与推理 token 剥离的缓存命中率分解、以及未来命中率提升空间的量化分析。作者认为 cache 空间是值得深耕的方向。

所属事件:Meta 开源 Suffix Cache Reuse,编辑轮缓存命中率大幅提升(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →