OpenAI IMO 成果被质疑:一次生成加自动形式化,不算证明搜索
GaryMarcus · x · 2026-10-07
针对 Gary Marcus 索要证据的追问,@IonelChiosa 详细解释了他对 OpenAI IMO 级别数学成果技术路线的批评:
- 验证环节可被 harness 替代:几乎每次生成完整解答后,一个简单的 harness(如 fable 在简单循环中)就能在不用 Lean 的情况下抓住错误
- 流程本质:只有一次 rollout、一次生成,先产出自然语言的最终解答,再自动形式化——这不是基于过滤的证明搜索,只是「健全性检查式翻译」
- 是否算「符号」:形式化步骤只用了几行 harness 代码,勉强算 symbolic,但远不配这个标签,引擎显然是 LLM
他预测 Claude 其实能不用 harness 解出今年全部 IMO 题,未来 AI 也能在没有任何人类设计 harness 的情况下复现 OpenAI 这类成果。Gary Marcus 则坚称「符号系统验证 + 神经网络生成候选」就是神经符号方法。
所属事件:Gary Marcus 与批评者激辩 OpenAI 数学 AI 是否「神经符号」(10 条相关)→
「模型」频道最新
- 用户直呼 Opus 5.5「就是懂」:模型行为口碑持续发酵 — rudrank · 2026-10-07
- Teknium 回应评测争议:半数 Hermes 用户拿来写代码 — Teknium · 2026-10-07
- 用户吐槽:ChatGPT 频繁推销无名第三方服务 — doodlestein · 2026-10-07
- Surrogate Rune v3 与 Xor 26B-A4B 两模型同日上榜 JevBench — airesearch12 · 2026-10-07
- Mistral Large 4 发布:AA 智能指数 38 分翻倍,开源权重本月放出 — shensi · 2026-10-07
- Intel 研究员:把 temp=0 当成 LLM 完全确定性的人我不会雇 — JFPuget · 2026-10-07