PUMA 用早停框架平均削减 26.2% 推理 token

jiqizhixin · x · 2026-07-26

PUMA 通过检测“推理已收敛”来提前停机

UIC、Google 等研究者提出 PUMA,这是一个可插拔的推理框架:当模型的中间推理已经开始重复、继续生成只是浪费 token 时,它会尝试提前退出,同时尽量不损失准确率和推理连贯性。

论文题目:Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →