Prefix Sliding:丢弃冗余推理 token,测试时扩展提速 3 倍
Bedrovelsen · x · 2026-08-27
新论文提出 Prefix Sliding 技术:研究发现模型推理过程中,大多数中间推理 token 的重要性会随后续推理迅速衰减,保留全部历史 token 的成本值得质疑。基于此,Prefix Sliding 只保留前缀和最近几千个 token 的滑动窗口,丢弃其余部分。
效果:无需任何训练,现有推理模型即可提速约 3 倍且性能基本不变;若结合强化学习在压缩设置下训练,还能通过扩展到超过十万级 token 的推理轨迹获得更好性能。论文附开源代码。
所属事件:Prefix Sliding 新技术:丢弃冗余推理 token 提速 3 倍(2 条相关)→
「Infra」频道最新
- Cursor 用户单月消耗 4720 亿 Token,算力成本成主要限制 — Daniel_Farinax · 2026-08-27
- llama.cpp 新增选项:支持密集模型 FFN 层 CPU 卸载 — jacek2023 · 2026-08-27
- 96GB Mac Studio 能否跑 Qwen3.8?SSD 卸载实测分析 — Mxmtm · 2026-08-27
- 亚马逊 S3 架构解密:280 万亿对象背后的 Rust 重写与热管理 — Franc0Fernand0 · 2026-08-27
- 个人车库算力巢实拍:5 节点 Mellanox 网络与家庭改造 — Substantial_Cut_9418 · 2026-08-27
- llama.cpp 合并 PR:新增 Nanbeige4.2-3B(dspark)支持 — jacek2023 · 2026-08-27