思维链里被放大的行为不预示正确:校准 Lift +80% 却没被放大,承认不确定被放大 3-7 倍但 Lift 为负

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

COLM 2026

cs.CL, cs.AI, cs.CV, cs.LG

2026-08-14

15 模型 15282 条思维链的行为分析:推理训练放大自我修正假设检验与承认不确定,但与正确性最相关的是置信校准知识对齐与自我觉察,thinking 模型的高分靠中途回错的恢复率(2-3 倍)。

这篇在解决什么

推理模型(thinking model)的思维链看起来更深思熟虑:会自我修正、会检验假设、会承认不确定。但「看起来在思考」和「思考的方式与答对相关」是两回事。推理训练可能只是在放大表层行为,让轨迹更长更认真,却没放大真正与正确性挂钩的行为。这篇把「被放大」和「有预测力」拆开量了一遍,发现两者确实脱节。

方法

两个核心指标。出现率:某行为在思维链里出现的比例。Behavioral Lift:该行为出现时答对的概率减去不出现时答对的概率,Lift(b) = P(correct|b) − P(correct|¬b)。正 Lift 意味着行为与更高准确率相关,负 Lift 相反。

样本:15 个开源模型(3B-9B,VLM 7 个 LLM 8 个,同家族 thinking/instruct 配对),6 个基准(VLM 用 VisualPuzzles/MathVista/MMMU,LLM 用 LogiQA2/MATH-500/MMLU-Pro,每题采样 350 左右),15282 条思维链。行为标注用 GPT-4o 当裁判,九个跨模态高阶行为:计划、目标追踪、假设检验、自我修正、不确定性承认、置信校准、自我觉察、证据引用、知识对齐;另有 7 种失败模式(逻辑失败、事后合理化、捷径、侥幸猜对等)。裁判信度:与 DeepSeek-V3、Gemini-2.5-Flash、Gemini-3-Flash 三个独立裁判在 600 个分层样本上对比,焦点行为 κ=0.51-0.82;人工抽 120 条 720 个二元判断,与 GPT-4o 一致率 95.1%(κ=0.902)。

结果

三个行为被推理训练显著放大:自我修正 21-55%(thinking)vs 3-15%(instruct);假设检验 22-52% vs 4-18%;不确定性承认 25-85% vs 4-28%,即 3-7 倍。

但 Lift 排名正好倒过来:

行为Lift(VLM)Lift(LLM)出现率变化
置信校准+72.2%+79.6%基本没变(部分基准 instruct 略高)
知识对齐+53.7%+80.3%未被放大
自我觉察+62.0%+52.7%未被放大
自我修正+20.1%+12.4%放大 4-17 倍
假设检验+1.0%+1.0%放大 2-13 倍
不确定性承认−16.1%−13.9%放大 3-7 倍

置信校准是最强的正确性信号:VLM 上出现时 98.8% 答对、不出现 26.7%;LLM 上 99.6% vs 20.0%。它出现在 94.7%(VLM)/95.9%(LLM)的健全推理轨迹里,在侥幸猜对里只有 7.6%/3.4%,说明它追踪的是推理质量,不是答案对错。而不确定性承认在错误轨迹里更常见(错误 30.8% vs 正确 20.1%),出现在 56.7% 的事后合理化轨迹里。

那 thinking 模型凭什么分高?靠恢复。检测到失败后翻正的比率(Recovery Rate)在计算型基准上 thinking 是 instruct 的 2-3 倍:VisualPuzzles 23.0% vs 8.4%(2.7 倍)、MATH-500 40.8% vs 17.8%(2.3 倍)、MMLU-Pro 16.8% vs 6.3%(2.7 倍)。模式匹配型任务反转:LogiQA2 上 instruct 恢复率反而高(24.5% vs 11.1%)。

规模上差距不收敛。32B 的 thinking 模型自我修正出现率 61.3% vs instruct 11.3%,但自我修正的 Lift 从 2B 的 +30.0% 掉到 32B 的 +5.9%,置信校准的 Lift 反而从 +57.7% 涨到 +68.7%,脱节随规模加剧。更大的 thinking 模型更少承认不确定(66.7% 降到 43.7%)。七个前沿闭源模型(五家供应商)在 GPQA-Diamond 上同排名:知识对齐 +84.2、置信校准 +77.9、不确定性承认 −23.2。

初步的提示词实验方向一致。给 OLMo-3-7B-Think 注入高 Lift 行为提示(校准加知识落地),MATH-500 准确率 +5.8pp,恢复率从 57.1% 到 68.9%;MMLU-Pro Math 上高低提示差 15.7pp。注入低 Lift 行为提示(不确定到饱和)在三个基准上全部降分。作者自己强调这是初步实验,提示一次改多个属性,没有分离单一行为。

为什么重要

对训练:如果目标是推理质量,过程奖励该盯校准、知识落地、自我觉察这些高 Lift 行为,而不是轨迹里有没有自我修正和假设检验的字样。表面形式最容易被优化器钻空子,奖励表面形式等于奖励表演。

对评测:长思维链和思维链里有自我修正,不能当成推理质量证据。不确定性表达的多少也不校准,它追踪难度而非校准水平。

对使用:模式匹配型任务上 thinking 模型可能不赚反亏(LogiQA2 恢复率反转),而需要中途回错再纠的任务上 thinking 的优势最大。

局限与存疑

作者自列四条:只分析可见轨迹,书面推理可能不完整、事后、不忠实于内部计算;标注来自自动裁判,尽管做了多裁判验证和人工抽查,系统性偏置仍可能;Lift 是描述性统计,高 Lift 行为可能是结果而非原因(模型走在正道上所以表现出校准,或者与第三个有用属性共现);提示词实验初步且 GPQA 差异不显著。再补一条:Lift 的量级天然与行为出现率耦合,出现率 95% 的行为(置信校准在健全轨迹里)和不出现的那 5% 比,分母极小,99.6% vs 20.0% 这种数字要按「极端不平衡下的条件概率差」读,别当成线性因果效应。全程 3B-9B 模型加一组前沿验证,中段规模是空的。

术语

原文与代码

相关论文

全部论文解读