溯因题上推理token跟踪人类反应时,随机解码把对齐从0.41抬到0.55

Thinking effort aligns between humans and reasoning models in abductive reasoning

Henry Arthur

EMNLP 2026

cs.CL, cs.AI

2026-09-02

120 名被试做 160 道常识溯因二选一。控制题面长度后,推理模型思考 token 与人类反应时显著相关,最强是 GPT-OSS-120B 的 r=0.552;按厂商推荐温度多次采样再平均,GPT-OSS-20B 的偏相关从 0.41 升到 0.55。

这篇在解决什么

de Varda 等人 2025 年在多种推理任务上发现,大推理模型(LRM)的思维链 token 数和人类反应时对齐。批评很快跟上:思维链未必忠实于内部计算,题目难度也可能被形式结构泄露,模型按「看起来难」的题多吐 token,并不真在搜。

这篇把场地换到溯因推理,Peirce 意义上的「给欠定前提找最佳解释」。湿草地可能是下雨、邻居浇水或井溢了,没有三段论那样的 mood 标记告诉你哪题难。演绎题可以从格式读出难度,模型有捷径可走;溯因题的难度只来自「每个假说能解释什么」,更适合拿来谈共享的思考成本。任务做成二选一的最佳解释:两段观察,两个假说,选更能同时解释两者的那个。材料来自 AI2 的 ART,本身用 BERT 对抗过滤挑过难分的假对。

方法

120 名美国英语母语者(Prolific 招募 127,去掉 7 名过快或中途离开),160 道 ART 测试集题目,四组不重叠,Q/P 键作答,平均 9.2 分钟。假说 A、B 长度最多差 1 个词,避免按长短猜。人类正确率 78.8%。题面总词数均值 33.5。

模型侧跟 de Varda 的方法:思维链 token 当思考成本,和人均反应时做偏相关,两边都取对数,并回归掉题面 token 数(各模型自己的分词器)。主设定贪婪解码、默认 reasoning effort。测了 DeepSeek-R1、Qwen3-235B/32B Thinking、GPT-OSS-20B/120B、GLM-4.5-Air、Kimi-K2 Thinking,外加非推理基线 DeepSeek-V3(提示里加 step by step,整段生成都算 token)。

再在 R1、GPT-OSS-20B、Qwen3-32B 上按厂商建议温度(0.6 或 1.0)多次采样,题目级取平均 token 和多数票答案。收敛标准是偏相关的 95% 区间宽度低于 0.03、再加一次运行均值变化低于 0.01。R1 跑 10 次,另外两个 25 次。同一套次数再跑温度 2,看高过建议值会怎样。所有 token–RT 相关都控制了题面长度,因为长度和人类 RT 的 r=0.669。

结果

贪婪解码下,控制长度后全部模型与人类 RT 显著相关。

模型偏相关 r
GPT-OSS-120B0.552
GPT-OSS-20B0.41
Qwen3-235B Thinking0.359
DeepSeek-R10.327
Kimi-K2 Thinking0.303
GLM-4.5-Air0.263
Qwen3-32B Thinking0.229
DeepSeek-V3(非推理)0.197

集成(题目级平均 log token) r=0.42,和 de Varda 组内三段论的 0.43 接近,高于关系推理的 0.27。R1 对 V3 的优势未达显著(Fisher z=1.23, p=0.217)。人类在 R1 做对的题上正确率 82.5%,做错的题上 47.8%,低于随机;模型共识正确率和人类正确率的偏相关 r=0.668。至少 75% 模型答错时人类 48.7%,至少 75% 答对时人类 84.6%。噪声天花板(分半信度 Spearman-Brown) r=0.861,GPT-OSS-120B 解释残差 RT 方差的 R²=0.303,约占可解释方差的 35%。参数量对不齐对齐强度:20B 的 GPT-OSS 排第二,远小于 R1 和 Kimi-K2。

随机解码再平均会抬对齐。GPT-OSS-20B 从 0.41 到 0.55(Steiger–Williams p<0.001),19 次运行收敛;Qwen3-32B 从 0.23 到 0.32,18 次收敛;R1 从 0.32 到 0.37,差异不显著,8 次收敛。温度 2 时 GPT-OSS-20B 掉到 0.22 且 25 次仍未收敛。错误对齐也是建议温度最稳:GPT-OSS-20B 在温度 1 时与人类对错的点二列 r=0.51,贪婪 0.42。

把 GPT-OSS-20B 的 reasoning effort 调到高,最难三分位正确率 69.2% 对低档 53.8%,总体 token–RT 对齐变化不大(低 0.34,高 0.30)。

为什么重要

溯因没有演绎题那种格式难度线索,token 仍跟踪人类 RT,而且人和模型错在相似的题上。这给「思维链长度能当思考成本的代理」补了一块更难钻空子的场地。对评测的直接建议是:厂商写在模型卡上的温度,配上多次采样再平均,对齐会高于温度 0 的单次贪婪;温度 2 那种创意档会把相关打散。参数规模在这道常识题上几乎不是决定因素,20B 的 GPT-OSS 打过 671B 的 R1。

对齐不等于机制相同。作者自己把话挡在「共享约束的经验现象」,不推「脑子和 Transformer 算法对应」。GPT-OSS-120B 也只吃掉噪声天花板的 35%。

局限与存疑

只用了一种溯因:最佳解释二选一,不覆盖假说生成,也不覆盖长篇侦探推理。主分析用默认 effort,没有按难度调,附录显示高 effort 只在最难三分位抬正确率,主结果可能被天花板压住。提示尽量贴人类指令,但模型对提示敏感,换指令可能改相关。不能排除 ART 进过预训练,熟悉度抬正确率;共享错误模式降低了「纯背答案」的嫌疑,排除不了污染。R1 对 V3 的差异不显著,常识溯因本身就吃预训练世界知识,V3 没有显式思维链也能蹭到弱相关。CoT 作为成本指标仍受「表演性脚手架」批评,这篇用多种解码和 effort 做了稳健性,没有从机制上关掉这条批评。

术语

原文与代码

社区讨论

相关论文

全部论文解读