专题 · FULL STORY

Marcus 质疑 OpenAI 数学成果风波

OpenAI 发布 IMO 级批量数学证明新成果后,Gary Marcus 连发帖并撰长文质疑其缺乏细节、是否真正神经符号,与技术社区多名成员展开激辩,争议持续发酵。

2026-10-07 ~ 2026-10-08 · 2 集 · 18 条

第 1 集 · Gary Marcus 与技术社区激辩 OpenAI 数学成果是否神经符号(2026-10-07,15 条)

围绕 OpenAI 的 IMO 级数学成果,Gary Marcus 于 10 月 7 日在 X 上连发多条帖子,与 altryne、IonelChiosa、TCzajka 等用户就「该系统是否属于神经符号方法」展开激烈争论。Marcus 的核心论点是:神经网络生成大量候选解、再由 Lean 等独立符号系统验证,这一组合本身就构成神经符号方法,也印证了他多年主张的「神经符号结合才是必经之路」;但他同时强调这离 AGI 仍然很远。争论当前并无定论,双方连「神经符号」的定义本身都未达成一致。

已确认

  • Gary Marcus 明确区分两种模式:神经网络独立解决问题,与神经网络仅提出候选答案、再由独立符号系统验证。他认为分不清这一区别就没资格评论 AI。
  • Marcus 具体追问验证细节:通过 Lean 形式化验证的解究竟有多少、系统运作机制是否有公开说明。altryne 回应称 Lean 证明是独立运行的验证流程,用来验证非 Lean 的 agentic loop 产出,并非生成过程的组成部分。
  • IonelChiosa 给出详细批评:验证环节可被 harness 替代——几乎每次生成完整解答后,一个简单 harness(如 fable 在简单循环里)就能不用 Lean 抓住错误;因此该路线以 LLM 引擎为主,harness 谈不上符号方法,也谈不上是证明搜索。
  • TCzajka 用类比正面回击:按 Marcus 的逻辑,Andrew Wiles 只是提出答案让别人读论文验证,岂非「没有真正理解数论、没证明费马大定理」;爱因斯坦提出相对论后同样由他人验证,提出答案再验证并不代表不理解。
  • Marcus 继续质疑:如果系统生成了上百万个候选解,最终只有一个通过 Lean 形式化验证的过滤,这就像「猴子和打字机」,把功劳全给生成器是否合理。面对被指误读,Marcus 强调了自己的原始立场。
  • Marcus 转发 @dimvar 的观点:在 AI 数学证明突破中,形式化验证系统 Lean 的功劳不亚于 AI 模型本身,是真正的使能者。
  • Marcus 还追问所谓 basic harness 难道不就是符号方法,延续其对「验证框架即符号系统」的界定;在被网友追问「前沿 LLM 裸解(无 Lean、无代码、无符号工具)能否解决开放数学问题」时,他称这是「一个真正聪明的问题」(完整答复细节帖内未展开)。
  • jeffreybowers 与 DeepMind 研究员 Andrew Lampinen 就符号系统与神经网络的关系另开一条争论线:Bowers 认为人类造的符号系统(如计算机)本身不含新能力,只是移除了人类工作记忆等性能限制,大脑本身可以进行符号计算。

尚未确认

  • OpenAI IMO 方案中 Lean 形式化验证实际参与的规模与机制(Marcus 索要的「通过 Lean 验证的解有多少」目前无公开数据回应;其「百万候选解只有一个过筛」的说法也未经官方证实)。
  • 反驳者质疑 Marcus 凭什么假定对方按其设想的方式使用 Lean,并指出据其所知 Erdős 论坛上的人并非如此操作;争论双方对「神经符号」的定义本身未达成一致。

为什么重要

这场争论表面是术语之争,实质关乎如何评估当前数学 AI 成果:如果 Lean 验证是不可或缺的环节,那么成果应记在「神经符号系统」头上而非纯 LLM;如果简单 harness 就能完成验证,则说明 LLM 引擎本身已足够强。TCzajka 的 Wiles/爱因斯坦类比则把争论推向认识论层面——「提出候选再由外部验证」究竟是理解的标志还是纯暴力搜索。这一判断直接影响对「数学 AI 距离 AGI 还有多远」的评估,也是 Marcus 与 LLM 路线支持者长期分歧的又一次集中爆发。Bowers 与 Lampinen 的交锋则把问题推向更底层:符号系统的价值究竟在于提供本质能力,还是仅在于放大神经网络已有的能力。

第 2 集 · Gary Marcus 炮轰 OpenAI 数学证明报告缺细节(2026-10-08,3 条)

针对 OpenAI 发布的「未发布模型」批量数学证明新成果,Gary Marcus 撰长文质疑,称「真正的新闻不是结果本身,而是他们没告诉我们的东西」。他指出报告关键信息全缺失:仅写「Same procedure」、使用未发布模型等表述过于模糊,既未说明具体方法与模型细节,也隐瞒了可能失败的尝试,这样的报告根本过不了同行评审。