DeepMind 立场论文:LLM 会归纳会证明,发明不了广义相对论

2026-08-17

DeepMind 立场论文以广义相对论为案例:LLM 拿下了归纳与演绎,唯独缺发明公理的溯因跳跃,出路是可交互 world model。

这篇在解决什么

「科学发现就是找一个更短的程序去压缩观测」,这个由 Schmidhuber 在 2008 年系统化的说法,是 AI 社区对创造力最流行的解释。它隐含一个推论:归纳(从数据统计规律)加演绎(从公理推定理)拼起来就是发现的全部,LLM 喂够算力就应该能发明下一个广义相对论。

DeepMind 研究员 Tom Zahavy(AlphaProof 团队成员,ICML 2026 立场论文)反对这个推论。他把爱因斯坦画给 Solovine 的那张著名草图当作计算案例:感官经验 E 与公理体系 A 之间隔着一次没有逻辑通路的「跳跃 J」,归纳和演绎都覆盖不了这段。论文要回答的问题很具体:把爱因斯坦当年掌握的全部知识给到现代 LLM,它能自己走到场方程吗?作者的答案是不能,缺的机制有名字,叫溯因(abduction)。

方法

论证框架取自 Peirce 对推理的三分:演绎是规则加案例推出结果,归纳是案例加结果反推规则,溯因是规则加结果反推案例,给意外的观察发明一个新解释。

在这个框架下,论文把 1907 到 1915 年广义相对论的诞生拆成构思、整合、数学验证三段,逐项排除前两种读法:

排除两项之后是论文的正面主张:从 E 到 A 那一步是溯因,更准确地说是 Magnani 定义的操纵性溯因,依托身体化模拟。爱因斯坦自称「一生中最快乐的想法」是标本:想象一个从屋顶自由下落的观察者,他会感觉不到引力场。先在脑内模拟出观察,再为它找一个现有框架给不出的解释,这不是符号变换。ARC-AGI 恰好卡在半路:每题只有 2 到 5 个网格对,稀疏到归纳不够用、又没有显式指令供演绎,只能做一次溯因跳跃;但论文指出它测的是解释那一半,没有身体化的成分。

结果

立场论文没有 benchmark,可核查的是它引用的事实链:

论断依据
归纳缺乏误差信号等效质量验证精度 10⁻⁹,水星异常被 Vulcan 假设吸收
演绎已被机械化AlphaProof 2024 IMO 银牌,2025 年多系统金牌,Aristotle 解开放问题
1913 年答案已近在眼前Riemann 张量被找出又因一个错误假设放弃,多耗两年
溯因是缺口LLM 被类比成高维「中文屋」,操纵物理语言而没有物理指称

对现有自动化发现系统的判词也在这里:AI Scientist 重组已有符号概念去优化指标,AlphaEvolve 在固定框架内依赖梯度做优化,两者都跨不过没有误差信号的公理生成这一步。

为什么重要

对做 AI4Science 的人,这篇把天花板画在了清楚的位置:范式内的验证与优化还有大量可自动化的空间,指望系统发明新范式则撞上缺机制这堵墙。对做模型的人,它给出一个具体方向:可反事实干预的、物理一致的可交互 world model。论文特意区分 Veo 这类视频生成器(苹果下落是训练分布里的主导延续,不是对引力的建模)与 Genie 这类可动作控制的世界模型,并说复现电梯思想实验需要的是「剪断缆绳」的干预能力。这个落点与 LeCun 的世界模型路线、李飞飞的空间智能论述同向。

局限与存疑

作者在附录自述:物理训练止于本科,历史解读全部依赖二手文献,并用 Gemini 打磨过文字。单作者立场论文,不是实验研究。

更要紧的是可证伪性。「归纳需要误差信号、演绎不能生成公理、所以存在第三种机制」是哲学论证,「LLM 在结构上不可能完成溯因」没有也无法用实验检验。一条显见的反驳路径论文没有处理:爱因斯坦本人的输入同样有限,如果承认超大规模多模态数据加上对的归纳偏置可能涌现出等价能力,结构性不可能就退化为当前架构不太可能。「语言中缺少先验符号表征」对多模态模型是否仍然成立,文中也没有展开。当方向性判断读是合适的,当定论读就过了。

术语

原文与代码

社区讨论

全部论文解读