提出 Prefix-Reuse FLOPs:任意上下文编辑让前缀缓存失效成本显形

RulinShao · x · 2026-09-30

研究团队原以为上下文编辑会挑战推理系统的 prefix cache 复用,实际验证后确实如此:任意位置的上下文编辑会使前缀缓存复用失效,产生隐藏的额外计算开销。

他们提出 Prefix-Reuse FLOPs(PFLOPs)这一指标来刻画这部分成本。论文的主要实验全部改用 PFLOPs 报告效率,结果显示上下文记忆模型(CLM)凭借更好的缓存策略仍然更高效。

团队还开发了 Suffix Cache Reuse(后缀缓存复用)技术,在不损失性能的前提下进一步降低 PFLOPs。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →