1978 年逻辑谜题书揭穿大模型「背答案」:换条件就崩
JafarNajafov · x · 2026-09-25
一条长文讲述 Raymond Smullyan 及其 1978 年谜题书《What Is the Name of This Book?》如何意外成为 AI 推理评测的照妖镜。
- Smullyan 其人:6 岁因哥哥「愚人节到底骗没骗我」的问题迷上逻辑;高中辍学自学数学,曾以艺名 Five-Ace Merrill 在芝加哥夜总会表演纸牌戏法谋生;1959 年在普林斯顿师从 Alonzo Church(图灵的导师)获博士。
- 骑士与无赖谜题:岛上骑士只说真话、无赖只说谎,靠「A 说『我们都是无赖』」这类题训练同时推演两个可能世界、看哪个崩溃,200 多道题层层加难。
- 2024 年的回响:AI 研究者用这些谜题测试模型是真推理还是记忆答案——模型训练后对练习题近乎全对,但只要微调条件(交换骑士/无赖身份、改一句话)就全面崩溃,说明它们背下了岛屿却没学会在上面走路。
- 启示:多数 benchmark 奖励答对,Smullyan 的谜题惩罚「停止思考、开始模式匹配」,一本 1978 年的谜题书抓到了十亿美元级评测漏掉的问题。
「模型」频道最新
- 曝 OpenAI 将在 DevDay 发布网络安全专用模型 GPT-6 Cyber — emmanuelvivier · 2026-09-25
- Anthropic 官方发布 Opus 5.5 提示词指南:校准力度而非拉满 — CodeByPoonam · 2026-09-25
- OrcaSAQ-2-27B 登上 HF 热榜:基于 Qwen3 的 3-bit 混合精度量化模型 — orcarouter · 2026-09-25
- AVIS 论文提出双轴自适应推理缩放,获 NeurIPS 2026 接收 — CSProfKGD · 2026-09-25
- 开发者亲历:Opus 5.5解决视频剪辑,「我成了唯一瓶颈」 — LeviTurk · 2026-09-25
- 并非所有任务都需要旗舰模型:本地部署与低价模型分流付费用户 — haider1 · 2026-09-25