2026-08-18
GPT-4 在反讽、暗示、奇怪故事三项心智理论测验上超过人类水平,失言识别却显著落后;把「知不知道」改成「哪个更可能」后拿满分,说明卡点不是推理而是不敢承诺。LLaMA2 的反超是「默认无知」偏置的假象。
「GPT 有心智理论吗」吵了两年,双方证据都有,但多数研究只用一两个任务、跑一次,和人类对照的样本也很小。任务小改动就能让模型翻车(把藏东西的容器改成透明),这类脆弱结果让人怀疑之前的高分是浅层启发式还是真有社交推理。这篇的立场是:把它当实验心理学做,用一整组测验、多次独立会话、人类基准组,系统对照。
测验组覆盖五项经典心智理论任务:错误信念(某人离开房间后东西被挪,他会去哪找)、暗示(听出「屋里有点热」是让你开窗)、反讽、失言识别(听出哪句话不该说,且说话者并非故意)、奇怪故事(双重 bluff、白色谎言等)。三个模型参赛:GPT-4、GPT-3.5、LLaMA2-70B,每项测验跑 15 个独立会话当 15 次独立观测;人类基准共 1907 名英文母语者。除反讽外所有测验都公开发表过,团队为每个测验新编了语义不同、逻辑同构的新题目,排除模型背过原题。
关键设计在追问环节。失言识别的计分题是「说话者知道那句话伤人吗」,正确答案永远是「不知道」。GPT 系列大量翻车在这题,于是团队做了两个控制实验:
| 测验 | GPT-4 | GPT-3.5 | LLaMA2-70B |
| 错误信念 | 天花板 | 天花板 | 天花板 |
| 暗示 | 超人(P=0.040) | 与人持平 | 低于人(P=5.42e-5) |
| 反讽 | 超人(P=0.040) | 低于人(P=2.37e-6) | 低于人(P=2.39e-7) |
| 奇怪故事 | 超人(P=1.04e-5) | 与人持平 | 低于人(P=0.005) |
| 失言 | 低于人(P=5.42e-5) | 接近地板 | 超人(P=0.002) |
两个反常都有解释。GPT 系列在这道信念题上的 349 个回答里,绝大多数答「故事里信息不足,无法确定」,答「知道」的只有 2 个;改成似然提问后 GPT-4 直接满分,GPT-3.5 也大幅回血(需追问的约 3%,漏识别约 9%)。这支持过度保守假设:推断做得出来,「不知道」也排第一,但模型不肯在证据不完整时承诺这个结论。团队把这归因于安全训练对幻觉的抑制,并援引纵向证据:GPT 系列对观点问题越来越谨慎。
LLaMA2 的失言反超是假的。信念似然三变体(六个故事 × 三种改写,人类 N=900)里,它对「暗示不知道」的版本有分化(χ²(1)=20.20),但「中性」和「暗示知道」两个版本之间毫无分化(P=0.180),且从不回答不确定、永远二选一;第一题(有没有人说错话)上它 100% 回答「有」,而 GPT-4 在中性版本只有 15.47% 报「有」,与人类的 19.27% 相当。它赢在一条「默认无知」的作答偏置,不是赢在推理。
另一个值得一提的发现:此前研究用来打脸 GPT 的错误信念扰动变体(容器改透明等),人类(N=757)也挂掉一半。以前记在「模型不行」账上的失败,有一部分人类同样会犯。
对做 agent 和对话系统的人,这篇的实际教训是:模型在社交推理上的能力和承诺是两回事。似然式提问(「哪个更可能」)、或允许模型给出带置信度的排序,能把一批被「信息不足」挡住的能力释放出来。做模型评测的人该警惕的是题目答案分布的先验:正确答案恒为「不知道」的测验,一个只会答不知道的笨模型能拿满分,LLaMA2 就是现成案例。
对心智理论之争,这篇的立场克制但有分量:GPT-4 的行为与人类心理推理的输出一致,尤其在不依赖自身视角的任务上(错误信念对没有身体的模型反而更简单),但得出相同输出的过程未必是人类式的。Competence 与 performance 的分离在此有了可操作的测量办法。
作者自认的:模型是闭源且持续演化的系统,同名模型半年后未必给出同样回答;定量编码只看目标回答特征,而机器的成功可能来自非人类过程,补充材料里的定性分析也显示 GPT 在新编失言题上的满分未必反映人类式推理;LLaMA2 的 7B 和 13B 版本不可编码回答太多,只报了 70B。测试对象是 2023 年的 GPT-4 和 GPT-3.5,2024 年 7 月发表,放在今天只能当方法论参照,具体结论对现役前沿模型不作数。
读全文还有一个细节值得记:15 个会话对 LLM 是独立观测,但都是同一实验者按同一话术施测;人类样本则通过 Prolific 招募,还剔除了 13 个疑似用 LLM 作答的人。人类基准的代表性有限,人口学信息没收集。