Suffix Cache Reuse:为 Agent 设计的 KV 缓存复用新方案
RulinShao · x · 2026-10-02
Rulin Shao 等人发布博客,详解 Context Language Models(CLM)在推理服务端的效率优化:Suffix Cache Reuse(SCR)。
- 现有服务引擎(SGLang、vLLM)基于 radix tree 只能复用最长匹配前缀,假设上下文是 append-only 的;一旦在中间编辑,即使未变的后缀也要重新 prefill。
- SCR 的做法:编辑把 B 替换为更短的 B′ 后,只 prefill B′,A 的缓存作为前缀复用,未变部分 C 的缓存直接移到新位置。
- 团队还提出 Prefix-Reuse FLOPs 指标,用于刻画 cache-aware 的真实服务成本。
- 核心主张:AI 系统应专为 AI 设计,如果前缀缓存妨碍了上下文自由访问,那就改进缓存本身;下一步或让 CLM 直接对缓存拥有控制权。
- 博客由 WAI 学生组织发布,同系列还覆盖 TMax 与 CLM 工作。
所属事件:Meta 开源后缀缓存复用方案大幅提升 Agent 推理效率(4 条相关)→
「Infra」频道最新
- llama.cpp 新增决策模型端点,单次前向给出选项概率 — ggerganov · 2026-10-02
- 德银首评 FormFactor 买入:Nvidia GPU 探针卡二供,目标价 200 美元 — demian_ai · 2026-10-02
- AI 需求推升内存价格,DRAM 供应持续吃紧 — FinanceYF5 · 2026-10-02
- 黄仁勋答电力约束:每瓦token经济学 favor NVIDIA,80家云伙伴55家在海外 — BenBajarin · 2026-10-02
- llama.cpp 新增 Decision Models,本地推理迎来新玩法 — paf1138 · 2026-10-02
- Agent 真瓶颈不在 GPU:CPU 工具执行与沙箱开销才是耗时大头 — ai · 2026-10-02