斯坦福 Prefix Sliding:只留前缀和滑窗,推理提速约 3 倍不重训
rohanpaul_ai · x · 2026-09-04
斯坦福新论文《Prefix Sliding for efficient test-time scaling》发现长链推理并不需要在内存里保留完整思维链:
- 方法:保留固定的任务/工具指令前缀,加一个近期推理的滑动窗口,随推理推进丢弃中间旧 token;窗口填满后每生成一个 token 的注意力成本恒定,不再随步数增长。
- 依据:注意力分析显示 prefix 和最新 token 获得绝大部分注意力,中间推理过程几乎被忽略。
- 成绩:在 Qwen3-1.7B 上,4096 token 窗口在 AIME25 得 33.9%,接近全注意力的 34.2%,推理约提速 3 倍,且无需重训练。
- 附带收益:恒定成本使强化学习 rollout 可以超过 10 万 token;速度/精度权衡上优于纯滑窗、反复摘要和 last-k 删除等替代方案。
「Infra」频道最新
- 字节拟在乌兰察布再建 5-6GW 算力集群,投资或达千亿元级 — pstAsiatech · 2026-09-04
- ASML 光刻机大量使用 FPGA,Xilinx 曾成医疗设备产能瓶颈 — PAstynome · 2026-09-04
- Tenstorrent 推 JapanFold:开源药物发现模型免 API 试用 — DavidBennett__ · 2026-09-04
- 分析师:至今没有非 NVIDIA 训练的模型能击败 NVIDIA 训练的模型 — BenBajarin · 2026-09-04
- 2023 年配的台式机如今比购入价还贵,成升值资产 — Darpinian · 2026-09-04
- OpenAI Jalapeño 芯片曝光:RTL 冻结到流片仅 9 个月 — thehiphopswami · 2026-09-04