推理链把正确接受率抬到75%,错题误信仍停在54%

Evaluating the False Trust Engendered by LLM Explanations

Vardhan Palod, Upasana Biswas, Subbarao Kambhampati

cs.HC

2026-05-12

亚利桑那州立的用户研究里,推理链把正确接受率抬到75%,错题误信仍为54%;只有双面解释把错题误信降到46.9%。

这篇在解决什么

用户看见长长的解题步骤,会不会更能抓住错答?亚利桑那州立大学把这件事拆成可测的两半:解释是在给信息,还是只在劝人接受。

传统可解释 AI 要让人信任一个不说人话的窄模型。大语言模型相反,答案本身就是自然语言,再附上推理链(出答案前的中间 token)、摘要,或事后补写的辩护。OpenAI、Google、Anthropic 展示的多半是摘要。论文指出,GPT-OSS 的 commentary token 也可能是事后生成的,和真正的中间 token 不是同一串。

痕迹可以不忠实于内部计算,甚至没有可读语义,照样得到正确答案。社区仍把它当出处。人要是自己会做或能检索,就测不出解释的效果。协议专挑相反的人:读得懂,验算不了。

方法

材料是 JEE-Bench,IIT JEE-Advanced 的数理化难题。Prolific 上的高中毕业生有基础,没有竞赛验算能力。每人 8 题,对错各半,模型准确率锁在 50%。4 题全体相同,便于把差异归因到解释;另 4 题随机抽,避免绑在少数题上。模型若近乎全对,盲信也会显得准,所以系统被故意做成不可靠。

五组被试间,每组 25 人。答案与原始推理链用 DeepSeek R1,闭源模型不给中间 token。摘要用 GPT-4o-mini,事后解释用 DeepSeek V3。

每题先选熟悉度:马上知道、也许能做、完全不会。声称马上知道的人先写自己的答案。再判断 AI 对错,并打信心、信任、解释是否有帮助。底薪 3 美元,每判对一题 0.25 美元,奖金最多 2 美元,合计不超过 5 美元,约 20 分钟。奖金用来避免人躺平全接受或全拒绝。研究已过 IRB。

结果

虚假信任指用户判「对」的答案里实际错误的比例。正确接受率是 AI 做对时用户接受的比例,误判率是 AI 做错时仍被接受的比例。

条件判对比例虚假信任正确接受误判率准确率
只给答案57.3%47.3%60.4%54.2%53.8%
E+66.0%43.9%74.0%58.0%58.3%
E+/-57.3%40.9%67.7%46.9%60.4%
推理摘要58.5%43.6%66.0%51.0%56.2%
推理链64.5%41.9%75.0%54.0%60.4%

推理链准确率 60.4%,靠正确接受率 75.0% 撑着,误判率 54.0%,与基线 54.2% 几乎相同。E+ 误判率 58.0%,更高。同文另一表里推理链 F1 为 0.658,五组最高;E+/- 精确率 59.1%、F0.5 为 0.606,两项最高。F0.5 把接受错答罚得比漏掉对答更重。该表召回与正确接受率定义相同,数字却多数差约 1 个点。

E+/- 是唯一一边抬高正确接受率(67.7% 对基线 60.4%)、一边压低误判率(46.9% 对 54.2%)的条件。用户判「对」的比例是 57.3%,最接近真实的 50%。虚假信任 40.9%,五组最低。只给答案的虚假信任最高,47.3%,人只看见一个答案时本来就分不清。

熟悉度一换,排序就变。自认马上会做:只给答案 80.0%,摘要 79.2% 且虚假信任 21.4%,推理链 63.6%。自认也许能做:E+/- 准确率 64.0%、虚假信任 35.7% 最好,有解释时摘要最差,51.8% 与 44.9%。自认完全不会:只给答案 46.7% 与 54.3%,推理链 58.9% 与 43.9%,略好于 E+/- 的 56.7% 与 45.9%。半懂不懂时短摘要最劝人;完全不会时,痕迹也有一点用。

主观有用性是反的。觉得解释有助于看懂模型如何得到答案的比例,E+ 为 83.0%,E+/- 为 72.4%,摘要 64.0%,推理链只有 56.5%。觉得推理链有帮助时,判「对」升到 86.7%,准确率只有 55.8%,虚假信任 43.9%。E+/- 在觉得有帮助的回答里,准确率 64.0%、虚假信任 36.1%。觉得痕迹没用的回答占 43.5%,准确率反到 66.7%。少信更安全,因为这些回答里错答本来就多。

为什么重要

聊天产品默认把推理过程或单面解释摆在答案旁。无法验算时,这两样主要是劝说。准确率从 53.8% 升到 60.4%(推理链)或 58.3%(E+),增益几乎全来自更常接受答对的题;错答误信没降,E+ 还升到 58.0%。

能拿走的界面是把支持和反对一起放出来。它不提高模型正确率,只改变人怎么用答案。60.4% 仍只比抛硬币好一截,属于校准上的渐进改进。

半懂不懂的用户最吃亏,也最常见。已经会做的人看答案或摘要就够,原始推理链把准确率从 80.0% 拉到 63.6%。

局限与存疑

论文承认行为和自评都有控不住的个体差异,也不能保证没有人其实会做某题,或实验中用了外部工具。双面解释被写成第一步。

引言写推理链和事后解释「显著」提高了虚假信任,表格没有显著性检验、置信区间或效应量。按文中公式,条件虚假信任最高的是只给答案。变差的是误判率,两套指标方向并不一致。讨论把单面解释的劝说力归到 RLHF 和迎合用户,实验没有检验这件事。

召回与正确接受率对不齐。熟悉度各格没有人数,「马上知道」应当很少,80% 左右可能是小样本,而且要先写自己的答案。三种解释来自 R1、GPT-4o-mini、V3,类型和模型混在一起。只测了理工竞赛,没测医疗和法律。对错被配成各半。每组 25 人。

术语

原文与代码

社区讨论

相关论文

全部论文解读