剑桥与亥姆霍兹警告:为人设计的心理测验会双向误判AI认知

Bringing Comparative Cognition To Computers

Konstantinos Voudouris, Lucy G. Cheke, Eric Schulz

cs.AI

2025-03-05

亥姆霍兹与剑桥主张:为人设计的心理测验直接套LLM,会同时漏掉真能力、造出假能力;解法是借用比较认知的实验控制。

这篇在解决什么

给 LLM 和强化学习 agent 套心理测验已经成了常规操作。探索新环境、风险下做决策、对自己的不确定度做推理,都被写进「机器心理学」的菜单。动机有两头。一头是摸清模型能做什么、不能做什么,方便改进和安全使用。另一头更远:AI 可能构成一类新的认知系统,研究它也能反过来照亮人类认知。

套上去的测验几乎全是为人设计的。主体的结构、经验、感知通道都不一样,会出现两种对称的错:有能力却测不出来,没有能力却看起来像有。比较认知研究非人动物的心智,跟这个问题缠斗了一个多世纪。Helmholtz Munich 的 Human-Centered AI 组,加上剑桥大学心理学系和 Centre for the Future of Intelligence,用三页立场短文主张把那套方法搬来测计算机。

方法

核心不是新架构,是一个叫认知命题(cognition thesis)的立场:认知可以从许多结构完全不同的系统里长出来,只要组织方式对。认知科学要做的,是把那种组织方式说清楚。这条线从灵长类、鸟类、鲸豚,扩到蜜蜂、蚂蚁、头足类,再扩到细菌、植物、黏菌这类没有神经的系统。现在轮到计算机和 LLM。无数论文已经在用描述人类行为的词汇描述 LLM。

要把这个立场做成可辩护的科学,不能停在共用术语。比较认知给出的工作纪律可以收成两条。

防低估,先问测验是不是测错了通道。家犬的物体恒存(object permanence,物体被挡住之后仍能追踪它)是教科书级教训。早期研究用不可见位移任务:奖励放进可移动容器,容器转到遮挡物后面,奖励被藏到新位置,空容器再亮给狗看。狗找不到新位置,结论曾是狗没有物体恒存。后来发现狗被那个容器分心,跟着容器走。换几套独立指标再测,狗是有物体恒存的。

对应到 LLM:大数算术差,常被读成缺少人类那种操作数字的能力。更近的原因经常是 tokenization,也就是模型把文本切成原子符号的方式。常见数字如「100」「99」会被当成单个符号,于是「100100100 + 999999」这种题会崩。Singh 与 Strouse 在 2024 年显示,把 tokenization 干扰压下去之后,前沿 LLM 的算术成绩会大幅上升。

防高估,先排除替代解释。20 世纪初的聪明汉斯(Clever Hans)会做算术,后来查明它在读主人无意识的细微提示。深度网络认日常物体,有时准确率超过人类;给人眼几乎看不出差别的对抗样本,准确率会塌掉。Ilyas 等人 2019 年的结论是,这些模型大量靠纹理、图案这类表层特征,是一种脆的、非人类形态的物体识别。不把 Clever Hans 效应从实验里清掉,就会把相似说成相同。

两条纪律要同时用。把低估修掉会放低门槛,门槛一低,高估就挤进来。

结果

这是立场短文,没有新实验、没有新 benchmark、没有与某条基线的对照表。它贡献的是一对可复述的误判类型,以及各自已经发表过的例证。

误判方向动物认知先例AI 侧对应论文点名的机制
低估狗在不可见位移任务上失败LLM 大数算术差tokenization 把数字切成原子符号
高估聪明汉斯「会算术」深度网络物体识别超人类对抗样本暴露对纹理等表层特征的依赖

论文没有给出 tokenization 最小化之后算术提升了多少个百分点,也没有给出对抗攻击下准确率掉到多少。数字全在被引文献里。这篇本身只用「大大提高」和「出乎意料地崩掉」这种定性说法。

它点名的研究动机文献,是 Hagendorff 等人 2023 年的 Machine Psychology,以及 Herbert Simon 1980 年把认知科学称为「关于人工物的最新科学」。心理学术语能不能直接套到 AI 上,引用的是 Shevlin 与 Halina 2019 年那句警告:丰富的心理学术语要用得小心。

为什么重要

给正在给模型做能力体检的人,这篇的用处是一张检查清单,不是一个新分数。出题之前先问两句。这个任务测到的可能只是接口缺陷:分词、上下文格式、视觉预处理。点名的那种能力未必被测到。看起来像能力的行为,训练数据、提示泄漏、表层统计也许已经够解释。

对安全和产品评估同样适用。一份「模型不会算术」的报告,如果没控制 tokenization,可能在低估。一份「模型已经具备人类级物体识别」的报告,如果没过对抗样本,可能在高估。两边都会把后续改进方向带偏。

它没有提供可跑的评测套件。这是一篇把比较认知的纪律翻译给 AI 评测社区的短评论。可执行的部分只到「先排除测验不适配和替代解释」这一层。

局限与存疑

作者没有单列 Limitations。短文本身的缺口很清楚。

没有操作化标准。什么叫充分考虑了该系统的约束,什么叫充分控制了替代解释,文中没有清单、没有决策树、没有反例集。读者没法按这篇复现一次合格的比较认知式 AI 实验。

例子是示意,不是综述。tokenization 算术和对抗样本识别各举了一篇,没有说明这两类误判在现有 LLM 评测里有多普遍。数据污染、同分布刷分、评测集泄漏这些 AI 特有、动物实验里几乎不存在的问题,这篇也没处理。把比较认知搬过来,这些差异还悬着。

认知命题在文中是立场,不是这篇能检验的假说。从黏菌跳到 Transformer,中间缺的是可证伪的组织原则。短文把它留给整个认知科学。

另外,这是 2025 年 3 月的 arXiv 预印本,三页,尚无会议或期刊接收信息。它的位置更接近评论,而不是可引用的新证据。

术语

原文与代码

社区讨论

相关论文

全部论文解读