PUMA 用早停框架平均削减 26.2% 推理 token
jiqizhixin · x · 2026-07-26
PUMA 通过检测“推理已收敛”来提前停机
UIC、Google 等研究者提出 PUMA,这是一个可插拔的推理框架:当模型的中间推理已经开始重复、继续生成只是浪费 token 时,它会尝试提前退出,同时尽量不损失准确率和推理连贯性。
- 核心由两部分组成:冗余检测器 + 答案验证。
- 冗余检测器会比较最近步骤的表示,识别重复或近似重复的推理轨迹。
- 随后系统会基于截断后的前缀生成一个试答案,再检查其置信度和一致性,决定是否停止。
- 如果验证失败,就继续生成;对于后期持续重复的情况,还提供了 Loop Breaker 作为兜底退出机制。
- 作者报告,在 5 个推理模型 和 5 个基准 上,平均可减少 26.2% 的 token,同时保持准确率和 CoT 质量。
论文题目:Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models
「研究」频道最新
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11