标注 15282 条推理轨迹:思考模型放大的行为并非最能预测正确
Jeande_d · x · 2026-10-04
Jean de Dieu Nyandwi 等人的 COLM 2026 论文《Amplified Does Not Mean Predictive》研究推理模型中哪些行为真正与答对相关,以及推理导向训练是否放大了这些行为。作者提出 Behavioral Lift 指标,衡量某行为出现在推理轨迹中时正确率变化幅度,在 15 个模型、6 个基准上标注了 15282 条轨迹(覆盖纯文本与视觉语言推理)。关键发现是「放大-提升鸿沟」:思考模型大幅放大自我纠正、假设检验、不确定性表述(后者放大 3-7 倍却与正确率弱相关甚至负相关),而提升最高的行为——置信度校准、知识对齐、自我觉察——几乎未被放大;置信度校准在两种模态中都是最强的正确性正向信号之一。结论:推理训练没有优先放大高 Lift 行为,应设计奖励校准、有据推理的过程级目标,而非只奖励表面形式。作者将于 10 月 8 日在 COLM 做海报展示。
「模型」频道最新
- 曝 Opus 5.5 大幅跃升,Anthropic 打乱 OpenAI 节奏 — haider1 · 2026-10-04
- Theo 实测后仍留 Opus 当主力,Sol 6.1 只取代 Sonnet 做审稿 — airesearch12 · 2026-10-04
- 曝 Anthropic 压哨发布 Fable 5.5,为 IPO 前保留的最强模型 — thesaraharminta · 2026-10-04
- GPT-6 新护栏被指不直接拒绝,而是悄悄替换任务内容 — moyix · 2026-10-04
- PewDiePie 自训本地模型被 OpenAI 两度封号,引蒸馏双标之争 — ccerrato147 · 2026-10-04
- RL 并非取代预训练:密集信号仍让它不可或缺 — akbirthko · 2026-10-04