AI 仍过不了这些智力测验:空间旋转与视觉推理是明显短板
MIT Tech Review AI · rss · 2026-08-26
MIT Technology Review 整理了一组曾让 AI 模型翻车的智力题,让读者亲自挑战,同时借此梳理当前大模型与人类认知的差异。
主要发现:
- 空间推理:语言模型即使能接收视觉输入,在心理旋转类题目上仍表现极差,无法像建筑师那样在脑中操纵 3D 物体。
- 记忆的副作用:模型超强记忆力反而成为弱点——当题目酷似训练数据中的经典题时,模型会忽略关键差异、套用记忆答案。Google 与 UIUC 2024 年在「骑士与骗子」谜题变体上的实验证实了这一点;SimpleBench 上人类能识破的陷阱,顶级模型照样上当。
- 抽象与视觉推理:ARC-AGI 是最著名的谜题类基准,研究发现即使模型答对,用的也是迂曲且不可泛化的规则,而人类依赖简单的视觉概念。若把网格编码成数字串而非图像,模型表现会更好。
- 直觉反转:人类有直觉偏差、常给膝跳式错误答案,而模型反而会审慎作答——这是人类独有的认知陷阱。
- 复杂度上限:Apple 研究发现 LLM 能解简单的汉诺塔和过河问题,但盘子/人数到六个以上就开始失败;ZebraLogic 逻辑格题也呈现类似的 scaling 极限。该论文曾爆红,但也有人质疑这只是复杂度堆积下的正常出错。
从 2024 年底 Columbia 团队测得最好的模型只能解 18% 的 NYT Connections 谜题,到 2025 年初部分模型近乎完美,AI 解谜能力进步飞快——但人类仍各有胜场。
「模型」频道最新
- 观察:Claude 开头这句词通常意味着搞砸了 — airesearch12 · 2026-08-26
- OpenRouter 平台模型使用量随时间变化趋势 — Which-Breadfruit-926 · 2026-08-26
- AI 模型在智力测试中频频翻车,人类仍占上风 — nordicinst · 2026-08-26
- 数据称开发者对模型零忠诚:Ox Alpha 三天碾压 DeepSeek V4 Flash — FinanceYF5 · 2026-08-26
- OX Alpha 凭借免费策略登顶 OpenRouter 使用量榜首 — Hesamation · 2026-08-26
- 27B 模型击败前沿模型?Qwen 3.8 实测惊人 — Gohab2001 · 2026-08-26