标注 15282 条推理轨迹:思考模型放大的行为并非最能预测正确

Jeande_d · x · 2026-10-04

Jean de Dieu Nyandwi 等人的 COLM 2026 论文《Amplified Does Not Mean Predictive》研究推理模型中哪些行为真正与答对相关,以及推理导向训练是否放大了这些行为。作者提出 Behavioral Lift 指标,衡量某行为出现在推理轨迹中时正确率变化幅度,在 15 个模型、6 个基准上标注了 15282 条轨迹(覆盖纯文本与视觉语言推理)。关键发现是「放大-提升鸿沟」:思考模型大幅放大自我纠正、假设检验、不确定性表述(后者放大 3-7 倍却与正确率弱相关甚至负相关),而提升最高的行为——置信度校准、知识对齐、自我觉察——几乎未被放大;置信度校准在两种模态中都是最强的正确性正向信号之一。结论:推理训练没有优先放大高 Lift 行为,应设计奖励校准、有据推理的过程级目标,而非只奖励表面形式。作者将于 10 月 8 日在 COLM 做海报展示。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →