专题 · FULL STORY
Marcus 质疑 OpenAI 数学成果风波
OpenAI 发布 IMO 级批量数学证明新成果后,Gary Marcus 连发帖并撰长文质疑其缺乏细节、是否真正神经符号,与技术社区多名成员展开激辩,争议持续发酵。
2026-10-07 ~ 2026-10-08 · 2 集 · 18 条
第 1 集 · Gary Marcus 与技术社区激辩 OpenAI 数学成果是否神经符号(2026-10-07,15 条)
围绕 OpenAI 的 IMO 级数学成果,Gary Marcus 于 10 月 7 日在 X 上连发多条帖子,与 altryne、IonelChiosa、TCzajka 等用户就「该系统是否属于神经符号方法」展开激烈争论。Marcus 的核心论点是:神经网络生成大量候选解、再由 Lean 等独立符号系统验证,这一组合本身就构成神经符号方法,也印证了他多年主张的「神经符号结合才是必经之路」;但他同时强调这离 AGI 仍然很远。争论当前并无定论,双方连「神经符号」的定义本身都未达成一致。
已确认
- Gary Marcus 明确区分两种模式:神经网络独立解决问题,与神经网络仅提出候选答案、再由独立符号系统验证。他认为分不清这一区别就没资格评论 AI。
- Marcus 具体追问验证细节:通过 Lean 形式化验证的解究竟有多少、系统运作机制是否有公开说明。altryne 回应称 Lean 证明是独立运行的验证流程,用来验证非 Lean 的 agentic loop 产出,并非生成过程的组成部分。
- IonelChiosa 给出详细批评:验证环节可被 harness 替代——几乎每次生成完整解答后,一个简单 harness(如 fable 在简单循环里)就能不用 Lean 抓住错误;因此该路线以 LLM 引擎为主,harness 谈不上符号方法,也谈不上是证明搜索。
- TCzajka 用类比正面回击:按 Marcus 的逻辑,Andrew Wiles 只是提出答案让别人读论文验证,岂非「没有真正理解数论、没证明费马大定理」;爱因斯坦提出相对论后同样由他人验证,提出答案再验证并不代表不理解。
- Marcus 继续质疑:如果系统生成了上百万个候选解,最终只有一个通过 Lean 形式化验证的过滤,这就像「猴子和打字机」,把功劳全给生成器是否合理。面对被指误读,Marcus 强调了自己的原始立场。
- Marcus 转发 @dimvar 的观点:在 AI 数学证明突破中,形式化验证系统 Lean 的功劳不亚于 AI 模型本身,是真正的使能者。
- Marcus 还追问所谓 basic harness 难道不就是符号方法,延续其对「验证框架即符号系统」的界定;在被网友追问「前沿 LLM 裸解(无 Lean、无代码、无符号工具)能否解决开放数学问题」时,他称这是「一个真正聪明的问题」(完整答复细节帖内未展开)。
- jeffreybowers 与 DeepMind 研究员 Andrew Lampinen 就符号系统与神经网络的关系另开一条争论线:Bowers 认为人类造的符号系统(如计算机)本身不含新能力,只是移除了人类工作记忆等性能限制,大脑本身可以进行符号计算。
尚未确认
- OpenAI IMO 方案中 Lean 形式化验证实际参与的规模与机制(Marcus 索要的「通过 Lean 验证的解有多少」目前无公开数据回应;其「百万候选解只有一个过筛」的说法也未经官方证实)。
- 反驳者质疑 Marcus 凭什么假定对方按其设想的方式使用 Lean,并指出据其所知 Erdős 论坛上的人并非如此操作;争论双方对「神经符号」的定义本身未达成一致。
为什么重要
这场争论表面是术语之争,实质关乎如何评估当前数学 AI 成果:如果 Lean 验证是不可或缺的环节,那么成果应记在「神经符号系统」头上而非纯 LLM;如果简单 harness 就能完成验证,则说明 LLM 引擎本身已足够强。TCzajka 的 Wiles/爱因斯坦类比则把争论推向认识论层面——「提出候选再由外部验证」究竟是理解的标志还是纯暴力搜索。这一判断直接影响对「数学 AI 距离 AGI 还有多远」的评估,也是 Marcus 与 LLM 路线支持者长期分歧的又一次集中爆发。Bowers 与 Lampinen 的交锋则把问题推向更底层:符号系统的价值究竟在于提供本质能力,还是仅在于放大神经网络已有的能力。
- Gary Marcus:OpenAI 数学证明靠神经符号结合,但离 AGI 仍远 — GaryMarcus · 2026-10-07
- altryne 质疑 Gary Marcus:Lean 证明只是验证环节而非生成过程 — altryne · 2026-10-07
- Gary Marcus 质疑数学 AI 成绩:Lean 验证究竟试了多少解、怎么运作 — GaryMarcus · 2026-10-07
- Gary Marcus 定义之争:符号验证+神经网络生成算不算神经符号 — GaryMarcus · 2026-10-07
- Gary Marcus 炮轰:神经网络自解题与符号验证提案是两回事 — GaryMarcus · 2026-10-07
- Gary Marcus 回应质疑:前沿 LLM 能否裸解开放数学难题? — GaryMarcus · 2026-10-07
- 批评者拆解 OpenAI IMO 路线:LLM 引擎为主,harness 谈不上符号方法 — IonelChiosa · 2026-10-07
- OpenAI IMO 成果被质疑:一次生成加自动形式化,不算证明搜索 — GaryMarcus · 2026-10-07
- Gary Marcus 质疑:百万次尝试只过一次验证,凭什么算 AI 会解题? — TCzajka · 2026-10-07
- 用 Wiles 与爱因斯坦反驳 Marcus:提出答案再验证也算真理解 — GaryMarcus · 2026-10-07
- Gary Marcus 追问:OpenAI IMO 方案的「基础 harness」算不算符号方法? — GaryMarcus · 2026-10-07
- Gary Marcus 转发观点:数学突破的功劳 Lean 与 AI 模型各占一半 — GaryMarcus · 2026-10-07
- OpenAI 数学成果再引争论:神经符号路线算不算兑现预言 — AndrewLampinen · 2026-10-07
- 符号是工具还是天生?联结主义与符号主义的 X 世纪之争 — jeffrey_bowers · 2026-10-07
- Gary Marcus 质疑 AI 成果:生成百万个解只有一个过筛,凭何邀功 — GaryMarcus · 2026-10-08
第 2 集 · Gary Marcus 炮轰 OpenAI 数学证明报告缺细节(2026-10-08,3 条)
针对 OpenAI 发布的「未发布模型」批量数学证明新成果,Gary Marcus 撰长文质疑,称「真正的新闻不是结果本身,而是他们没告诉我们的东西」。他指出报告关键信息全缺失:仅写「Same procedure」、使用未发布模型等表述过于模糊,既未说明具体方法与模型细节,也隐瞒了可能失败的尝试,这样的报告根本过不了同行评审。
- Gary Marcus 炮轰 AI 数学证明报告:信息模糊到过不了同行评审 — GaryMarcus · 2026-10-08
- Gary Marcus 炮轰 OpenAI 数学证明报告:关键信息全缺失,过不了同行评审 — GaryMarcus · 2026-10-08
- Gary Marcus 质疑 OpenAI 数学成果:报告零细节,通过不了同行评审 — GaryMarcus · 2026-10-08