Evaluating the False Trust Engendered by LLM Explanations
Vardhan Palod, Upasana Biswas, Subbarao Kambhampati
cs.HC
2026-05-12
亚利桑那州立的用户研究里,推理链把正确接受率抬到75%,错题误信仍为54%;只有双面解释把错题误信降到46.9%。
用户看见长长的解题步骤,会不会更能抓住错答?亚利桑那州立大学把这件事拆成可测的两半:解释是在给信息,还是只在劝人接受。
传统可解释 AI 要让人信任一个不说人话的窄模型。大语言模型相反,答案本身就是自然语言,再附上推理链(出答案前的中间 token)、摘要,或事后补写的辩护。OpenAI、Google、Anthropic 展示的多半是摘要。论文指出,GPT-OSS 的 commentary token 也可能是事后生成的,和真正的中间 token 不是同一串。
痕迹可以不忠实于内部计算,甚至没有可读语义,照样得到正确答案。社区仍把它当出处。人要是自己会做或能检索,就测不出解释的效果。协议专挑相反的人:读得懂,验算不了。
材料是 JEE-Bench,IIT JEE-Advanced 的数理化难题。Prolific 上的高中毕业生有基础,没有竞赛验算能力。每人 8 题,对错各半,模型准确率锁在 50%。4 题全体相同,便于把差异归因到解释;另 4 题随机抽,避免绑在少数题上。模型若近乎全对,盲信也会显得准,所以系统被故意做成不可靠。
五组被试间,每组 25 人。答案与原始推理链用 DeepSeek R1,闭源模型不给中间 token。摘要用 GPT-4o-mini,事后解释用 DeepSeek V3。
每题先选熟悉度:马上知道、也许能做、完全不会。声称马上知道的人先写自己的答案。再判断 AI 对错,并打信心、信任、解释是否有帮助。底薪 3 美元,每判对一题 0.25 美元,奖金最多 2 美元,合计不超过 5 美元,约 20 分钟。奖金用来避免人躺平全接受或全拒绝。研究已过 IRB。
虚假信任指用户判「对」的答案里实际错误的比例。正确接受率是 AI 做对时用户接受的比例,误判率是 AI 做错时仍被接受的比例。
| 条件 | 判对比例 | 虚假信任 | 正确接受 | 误判率 | 准确率 |
| 只给答案 | 57.3% | 47.3% | 60.4% | 54.2% | 53.8% |
| E+ | 66.0% | 43.9% | 74.0% | 58.0% | 58.3% |
| E+/- | 57.3% | 40.9% | 67.7% | 46.9% | 60.4% |
| 推理摘要 | 58.5% | 43.6% | 66.0% | 51.0% | 56.2% |
| 推理链 | 64.5% | 41.9% | 75.0% | 54.0% | 60.4% |
推理链准确率 60.4%,靠正确接受率 75.0% 撑着,误判率 54.0%,与基线 54.2% 几乎相同。E+ 误判率 58.0%,更高。同文另一表里推理链 F1 为 0.658,五组最高;E+/- 精确率 59.1%、F0.5 为 0.606,两项最高。F0.5 把接受错答罚得比漏掉对答更重。该表召回与正确接受率定义相同,数字却多数差约 1 个点。
E+/- 是唯一一边抬高正确接受率(67.7% 对基线 60.4%)、一边压低误判率(46.9% 对 54.2%)的条件。用户判「对」的比例是 57.3%,最接近真实的 50%。虚假信任 40.9%,五组最低。只给答案的虚假信任最高,47.3%,人只看见一个答案时本来就分不清。
熟悉度一换,排序就变。自认马上会做:只给答案 80.0%,摘要 79.2% 且虚假信任 21.4%,推理链 63.6%。自认也许能做:E+/- 准确率 64.0%、虚假信任 35.7% 最好,有解释时摘要最差,51.8% 与 44.9%。自认完全不会:只给答案 46.7% 与 54.3%,推理链 58.9% 与 43.9%,略好于 E+/- 的 56.7% 与 45.9%。半懂不懂时短摘要最劝人;完全不会时,痕迹也有一点用。
主观有用性是反的。觉得解释有助于看懂模型如何得到答案的比例,E+ 为 83.0%,E+/- 为 72.4%,摘要 64.0%,推理链只有 56.5%。觉得推理链有帮助时,判「对」升到 86.7%,准确率只有 55.8%,虚假信任 43.9%。E+/- 在觉得有帮助的回答里,准确率 64.0%、虚假信任 36.1%。觉得痕迹没用的回答占 43.5%,准确率反到 66.7%。少信更安全,因为这些回答里错答本来就多。
聊天产品默认把推理过程或单面解释摆在答案旁。无法验算时,这两样主要是劝说。准确率从 53.8% 升到 60.4%(推理链)或 58.3%(E+),增益几乎全来自更常接受答对的题;错答误信没降,E+ 还升到 58.0%。
能拿走的界面是把支持和反对一起放出来。它不提高模型正确率,只改变人怎么用答案。60.4% 仍只比抛硬币好一截,属于校准上的渐进改进。
半懂不懂的用户最吃亏,也最常见。已经会做的人看答案或摘要就够,原始推理链把准确率从 80.0% 拉到 63.6%。
论文承认行为和自评都有控不住的个体差异,也不能保证没有人其实会做某题,或实验中用了外部工具。双面解释被写成第一步。
引言写推理链和事后解释「显著」提高了虚假信任,表格没有显著性检验、置信区间或效应量。按文中公式,条件虚假信任最高的是只给答案。变差的是误判率,两套指标方向并不一致。讨论把单面解释的劝说力归到 RLHF 和迎合用户,实验没有检验这件事。
召回与正确接受率对不齐。熟悉度各格没有人数,「马上知道」应当很少,80% 左右可能是小样本,而且要先写自己的答案。三种解释来自 R1、GPT-4o-mini、V3,类型和模型混在一起。只测了理工竞赛,没测医疗和法律。对错被配成各半。每组 25 人。