新算法 Prefix Sliding 实现推理速度翻倍,且无损性能

Muennighoff · x · 2026-08-27

Niklas Muennighoff 等人发布新论文《Prefix Sliding for efficient test-time scaling》。针对长上下文推理中全注意力机制带来的高昂算力成本,研究发现中间推理 Token 重要性随时间衰减。新方法 Prefix Sliding 仅保留关键前缀(指令/工具定义)和最近 Token 的滑动窗口,在无训练情况下实现 3 倍提速并保持性能;结合强化学习训练可支持十万 Token 级推理。实验证明其优于传统的摘要压缩和普通滑动窗口。

所属事件:Prefix Sliding 新算法让长推理提速 3 倍且无损性能(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →