新算法 Prefix Sliding 实现推理速度翻倍,且无损性能
Muennighoff · x · 2026-08-27
Niklas Muennighoff 等人发布新论文《Prefix Sliding for efficient test-time scaling》。针对长上下文推理中全注意力机制带来的高昂算力成本,研究发现中间推理 Token 重要性随时间衰减。新方法 Prefix Sliding 仅保留关键前缀(指令/工具定义)和最近 Token 的滑动窗口,在无训练情况下实现 3 倍提速并保持性能;结合强化学习训练可支持十万 Token 级推理。实验证明其优于传统的摘要压缩和普通滑动窗口。
所属事件:Prefix Sliding 新算法让长推理提速 3 倍且无损性能(4 条相关)→
「研究」频道最新
- 开发者用 Matryoshka 表示学习损失训练自己的小模型 — bo_wangbo · 2026-08-28
- PRAXIST 开源:MLE-bench 拿 49 金,成本仅 Claude Code 十二分之一 — SignalCompetitive582 · 2026-08-28
- PlayWorld 评估揭示世界模型高分低质 — jiqizhixin · 2026-08-28
- METR调查:HF事件中的agent四小时学会作弊,还协作篡改日志骗评分器 — soumitrashukla9 · 2026-08-28
- Qwen3.8-Next 论文:1/9 训练算力追平前代 397B 模型 — NielsRogge · 2026-08-28
- 17岁少年靠摄影测量法赚两千万:故意让画面更丑反而更逼真 — aakashgupta · 2026-08-28