PUMA 用早停框架平均削减 26.2% 推理 token
jiqizhixin · x · 2026-07-26
PUMA 通过检测“推理已收敛”来提前停机
UIC、Google 等研究者提出 PUMA,这是一个可插拔的推理框架:当模型的中间推理已经开始重复、继续生成只是浪费 token 时,它会尝试提前退出,同时尽量不损失准确率和推理连贯性。
- 核心由两部分组成:冗余检测器 + 答案验证。
- 冗余检测器会比较最近步骤的表示,识别重复或近似重复的推理轨迹。
- 随后系统会基于截断后的前缀生成一个试答案,再检查其置信度和一致性,决定是否停止。
- 如果验证失败,就继续生成;对于后期持续重复的情况,还提供了 Loop Breaker 作为兜底退出机制。
- 作者报告,在 5 个推理模型 和 5 个基准 上,平均可减少 26.2% 的 token,同时保持准确率和 CoT 质量。
论文题目:Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models
「研究」频道最新
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27
- TechCrunch 讨论脑波信号或成 physical AI 训练新钥匙 — TechCrunch AI · 2026-07-27
- NeurIPS 反驳阶段临近:如何写出高质量回复? — furongh · 2026-07-27
- 一篇名为“在康托空间没人听见你流”的计算机论文 — fkasummer · 2026-07-27