Meta 开源 Suffix Cache Reuse:上下文编辑时 KV cache 复用率大幅提升
RulinShao · x · 2026-10-02
Meta 研究团队(Rulin Shao 等)开源了 Suffix Cache Reuse(SCR)的 SGLang 补丁,用于高效服务 context language model(CLM)。核心问题:CLM 会编辑自己的上下文,改动发生在 prompt 中间而非末尾,标准前缀缓存只要遇到第一个不匹配就需重新 prefill 之后所有 token。SCR 的做法是:当片段 B 被替换为 B′ 时,复用所有幸存 token(包括其后缀 C)的缓存状态,只对新插入/追加的 token 重新 prefill;幸存后缀带着旧前缀编码的 stale cache 反而可能保留更丰富的历史信息。附带材料包括:基于混合注意力(全注意力+线性注意力交错)的实现细节、CLM 上下文编辑与推理 token 剥离的缓存命中率分解、以及未来命中率提升空间的量化分析。作者认为 cache 空间是值得深耕的方向。
所属事件:Meta 开源 Suffix Cache Reuse,编辑轮缓存命中率大幅提升(2 条相关)→
「Infra」频道最新
- 9 月本地模型盘点:27B 塞进 5.9GB、手机级 35B 等数十款发布 — vramkickedin · 2026-10-02
- Liquid AI 决策模型 D1 上线 OpenRouter:返回带概率的结构化答案,输入每百万 token 仅 4 美分 — maximelabonne · 2026-10-02
- 少年流片芯片、挖英伟达高管:又一位低调造芯片的年轻人 — ai · 2026-10-02
- huggingface_hub v2.1.0 发布:下载最高提速 17 倍,Jobs 支持重试与端口暴露 — huggingface · 2026-10-02
- 自托管 LLM 到底值不值?工程师征集团队真实成本账 — One_Mention_5385 · 2026-10-02
- Gemini 4 未发布先遭群嘲,TPU 算力优势被低估 — haider1 · 2026-10-02