专题 · FULL STORY

LLM极限之争:能否实现科学直觉跃迁

DeepMind论文指出大语言模型缺乏科学发现的关键直觉跃迁能力,引发LeCun与Hinton等大佬激辩。业界深入探讨了纯LLM路线的结构性局限与未来潜力。

2026-07-27 ~ 2026-08-07 · 7 集 · 35 条

第 1 集 · AI攻入数学搜索前线,深层理论仍待突破(2026-07-27,3 条)

帖子认为,AI 正在数学、软件和药物等可验证领域形成“生成假设—测试—修正”的持续搜索循环;在数学与理论物理中,它已在短程任务和借反例证伪上展现进展,但面对依赖深层理论、新概念与范式跃迁的猜想,现有方法仍难突破。

第 2 集 · DeepMind论文称LLM缺乏科学发现关键“直觉跃迁”(2026-07-28,7 条)

Google DeepMind研究员Tom Zahavy在ICML 2026发表立场论文《LLMs Can't Jump》,指出当前大语言模型(LLM)在数据压缩和逻辑演绎方面表现出色,但无法完成科学发现中关键的“直觉跃迁”——即从感知经验直接跳跃到抽象公理的非逻辑过程。论文以爱因斯坦提出广义相对论为例,说明基础科学突破需要超越现有数据的公理跨越。Zahavy随后澄清,这是一篇个人立场论文,并非DeepMind官方表态,也不意味着LLM永远无法做出科学发现;前沿实验室和学界已在用LLM推动真实科学进展。

已确认

  • Tom Zahavy参与的论文将科学发现拆解为三步:接触感知数据、通过非逻辑的“直觉跃迁”提出抽象公理、最后进行严格逻辑演绎。
  • 论文认为,当前LLM擅长组合型任务和逻辑演绎,但在需要人类概念先验的领域仍存在结构性限制,无法完成科学发现中关键的“直觉跃迁”。
  • 论文以爱因斯坦提出广义相对论为例,说明基础科学突破需要超越现有数据的公理跨越。
  • Tom Zahavy明确澄清,这是一篇个人立场论文,并非DeepMind的官方表态,也不是在宣称LLM永远无法做出科学发现。他强调前沿实验室和学界已经在用LLM推动真实的科学进展。

为什么重要

  • 该研究直接触及当前AI领域的核心争议:扩大模型规模和增加数据量是否足以实现通用人工智能(AGI)。
  • 观察人士Peter Berezin等人据此认为,如果LLM无法跨越概念创新的鸿沟,那么当前的技术路线可能只是通向超级智能的死胡同。
  • 这项研究为评估大模型的真实能力提供了新视角,明确了当前AI技术在基础科学创新方面的边界与挑战。

第 3 集 · AI辅助解决FrontierMath四十年未解难题(2026-07-28,3 条)

开发者David Turturean宣布,他主要依靠语音交互使用AI,成功解决了EpochAI FrontierMath的一个开放性数学问题。该问题涉及2-adic numbers的绝对伽罗瓦群表示,是悬而未决约40年的难题。这是FrontierMath开放问题基准迎来的首个实质性突破,充分展现了AI在辅助前沿数学研究方面的巨大潜力。

第 4 集 · DeepMind论文:LLM能推导相对论但无法发明它(2026-07-30,5 条)

Google DeepMind 的一篇论文(作者 Tom Zaharay)探讨了大语言模型在科学发现中的结构性局限,指出当前 AI 无法完成真正意义上的科学发明。论文将科学发现拆解为归纳、演绎和溯因三个过程,并以爱因斯坦提出广义相对论为案例:当时牛顿力学预测与观测误差仅 10⁻⁹,LLM 能基于已知前提进行推导,但在结构上无法完成提出新科学前提所需的「溯因跳跃」。开发者 JoshuaJBouw 结合自身在边缘计算项目中的实践印证了这一观点:当前大模型遇到未知问题时,往往会生硬地退回到旧的已知技术,缺乏创造性跨越能力。

已确认

  • DeepMind 论文将科学发现拆解为归纳、演绎和溯因三个核心过程。现代生成式 AI 擅长模式识别(归纳)和基于已知前提的逻辑推导(演绎)。
  • 论文以爱因斯坦提出广义相对论为案例指出,在牛顿力学预测与观测极度吻合(误差仅 10⁻⁹)的情况下,LLM 能够进行推导,但在结构上无法完成提出新科学前提所需的溯因跳跃。
  • 开发者 JoshuaJBouw 结合自身在边缘计算项目中的实践经验,印证了论文的核心观点:当前大模型在遇到未知问题时,往往会生硬地退回到旧的已知技术,缺乏创造性的跨越能力。

为什么重要

  • 这一研究结论明确了当前 AI 能力的边界。它表明 LLM 虽然是强大的知识应用和演绎工具,但在复杂定理证明和高级抽象科学发现方面存在根本的短板,无法替代人类科学家的原创性思维。

第 5 集 · LeCun与Hinton激辩:代码生成系统是否超越纯LLM(2026-08-04,9 条)

Yann LeCun 在 X 平台明确表示,真正好用的代码生成系统并不只是纯自回归 token 预测(即纯 LLM),这一观点引发与 Geoffrey Hinton 的激烈交锋。双方围绕大模型发展路线展开辩论,核心分歧在于复杂系统组合与纯模型扩展(Scaling)孰优孰劣。这场争论触及 AI 发展的核心路线选择,并引发社区对“事后改写历史”叙述和“苦涩教训”适用性的质疑。

已确认

  • Yann LeCun 强调,他讨论的对象是纯自回归 token 预测,也就是普通 LLM 的工作方式。他认为,强大的代码生成系统并不只局限于这一个单一的预测循环。
  • 面对社区对其观点的疑惑与指责,LeCun 态度强硬,称自己的言辞是对网友“无知侮辱”的恰当回应。
  • Geoffrey Hinton 加入辩论并回击 LeCun,双方在 X 平台上围绕大语言模型的发展路线展开交锋,互指对方观点傲慢或无知。
  • @suchenzang、@mathemagic1an 与 @danielmac8 等人指出,外界存在一种“事后改写历史”的叙述,试图证明某种单一系统路线早就是唯一正确答案。他们支持澄清这一误解,强调不应把所有代码系统都简单等同于纯 LLM。

尚未确认

  • @lambdaviking 提出对当前行业趋势的质疑:过去坚持“Scaling”观点的人曾反对把 LLM 塞进复杂系统,但现在将开源模型嵌入复杂系统并包装成“neurosymbolic(神经符号)”的做法,是否真的违背了“苦涩教训”中所强调的通用算力优于人工归纳偏置的规律,目前仍无定论。

为什么重要

  • 这场争论触及了当前 AI 发展的核心路线分歧:是继续押注纯 LLM 的参数与算力扩展,还是转向构建包含多种模块的复杂系统。明确“纯 LLM”与“完整系统”的边界,有助于客观评估各类代码生成工具的实际能力与技术底座。

第 6 集 · 驳斥LeCun等质疑:LLM是通向超级智能的必经之路(2026-08-05,3 条)

针对 Yann LeCun、Gary Marcus 等人关于“纯 LLM 是死胡同”的质疑,AI 社区近期引发了激烈争论。反对者指出,贬低 LLM 路线的学者往往因不看好而未投入研究,但实际上现代大模型是当今 AI 系统不可或缺的基石。文章强调,尽管未来 AI 可能会演变为更高维度的世界模型,但继续投资和扩展 LLM 依然是通向人类级别 AI 和超级智能的必经之路。

第 7 集 · DeepMind论文引热议:LLM缺乏科学发现的直觉跳跃能力(2026-08-06,5 条)

近期业界围绕大语言模型(LLM)在科学创新上的局限性展开深入探讨。多方分析与一篇被广泛引用的DeepMind立场论文指出,LLM虽在归纳与演绎上表现惊人,但受限于纯语言架构,无法完成产生真正科学突破所需的创造性“溯因跳跃”。这一共识表明,单靠语言模型无法实现科学飞跃,未来AI需要引入多模态世界模型来补齐短板。

已确认

  • 推理能力的边界:多篇帖子均将推理分为三种类型。@maierak与@bigdata指出,LLM已经精通统计归纳(模式拟合)和形式演绎(如定理证明),但无法进行“溯因跳跃”。
  • 科学创新的阻碍:@maierak以爱因斯坦发现相对论为例,说明科学飞跃需要创造出超越现有数据的新公理与直觉跨越,这是当前LLM底层架构无法做到的。@skdh也提到物理学家Tim Gowers的观点,认为证明的演进是一种方法上的元外推,创造力并非凭空产生。

为什么重要

  • 指明AI下一步走向:@bigdata与@maierak均强调,由于LLM受限于语言本身对现实理解的局限,AI要实现更高级别的智能(如科学发现),就必须突破现有的纯文本架构,走向结合多模态世界模型的道路。