Prefix Sliding:丢弃冗余推理 token,测试时扩展提速 3 倍

Bedrovelsen · x · 2026-08-27

新论文提出 Prefix Sliding 技术:研究发现模型推理过程中,大多数中间推理 token 的重要性会随后续推理迅速衰减,保留全部历史 token 的成本值得质疑。基于此,Prefix Sliding 只保留前缀和最近几千个 token 的滑动窗口,丢弃其余部分。

效果:无需任何训练,现有推理模型即可提速约 3 倍且性能基本不变;若结合强化学习在压缩设置下训练,还能通过扩展到超过十万级 token 的推理轨迹获得更好性能。论文附开源代码。

所属事件:Prefix Sliding 新技术:丢弃冗余推理 token 提速 3 倍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →