提出 Prefix-Reuse FLOPs:任意上下文编辑让前缀缓存失效成本显形
RulinShao · x · 2026-09-30
研究团队原以为上下文编辑会挑战推理系统的 prefix cache 复用,实际验证后确实如此:任意位置的上下文编辑会使前缀缓存复用失效,产生隐藏的额外计算开销。
他们提出 Prefix-Reuse FLOPs(PFLOPs)这一指标来刻画这部分成本。论文的主要实验全部改用 PFLOPs 报告效率,结果显示上下文记忆模型(CLM)凭借更好的缓存策略仍然更高效。
团队还开发了 Suffix Cache Reuse(后缀缓存复用)技术,在不损失性能的前提下进一步降低 PFLOPs。
「研究」频道最新
- Anthropic AI 攻克渗流理论“圣杯”难题,菲尔兹奖得主预言几天后应验 — aran_nayebi · 2026-09-30
- Ben Recht 撰文质疑 NFL 胜率模型:精确到小数点后三位的概率从何而来 — beenwrekt · 2026-09-30
- 研究团队发布迄今最多样化 deepfake 检测刺激集,探索注意力引导提升人类辨别力 — mattgroh · 2026-09-30
- λ-JEPA 提出谱正则化 SACReg,防表征坍缩并超越 LeJEPA — ClementineDomi6 · 2026-09-30
- SaveRouter论文:LLM路由只用四成监督数据即可回本 — SinapisAI · 2026-09-30
- Xavier Bresson 图机器学习课程第八讲:图卷积网络 — xbresson · 2026-09-30