GPT-5.6 Pro等模型连破数学猜想,但验证频翻车

近期,GPT-5.6 Pro、Fable 5 等 AI 模型据称在数学领域连续取得惊人突破,引发社区高度关注,但后续验证表明部分成果存在严重的幻觉问题,暴露了当前大模型在严谨逻辑推理上的脆弱性。

已确认

多名用户分享了 AI 模型在解决复杂数学猜想上的惊人成果。@haider1 发帖称,GPT-5.6 和 Fable 5 在一周内推动了三项数学突破,包括推翻已有 87 年历史的 Jacobian Conjecture。@scaling01 报告称,他仅让 GPT-5.6 Pro 分析“2026 年 LLM 解决过哪些问题”并提示“做一个突破”,模型便给出了二维高斯矩猜想的证明。@cloneofsimo 和 @Polymarket 等人指出,GPT-5.6 Pro 在被反复强调“继续找、别停”的极简提示下,找到了具体反例(如指出某图的 fractional flow cost = 58),证伪了存在约 30 年的 Dinitz-Garg-Goemans 图论猜想。此外,@jxnlco 转发的线程称,GPT-5.6 Sol 配合 Codex 工作流在 5 天内解决了 6 个 Erdős 开放问题,且声称该流程并不依赖很深的数学知识。

尚未确认

AI 证明的严谨性很快遭到质疑。由于许多推文作者(如 @scaling01)坦言自己看不懂模型给出的证明,往往需要引入其他模型进行交叉验证,这直接暴露了 AI 数学推理的脆弱性。@scaling01 在后续推文中明确指出,AI 数学证明再次翻车:在验证过程中,Fable 模型针对 Casas-Torres 等问题给出的反例被证实完全是错误的。此外,部分相关推文(如 @zacharynado)本质上是在玩“AI 做研究”的梗图,并非严肃的科研结论。

为什么重要

这一事件表明,尽管大模型展现出令人惊讶的发散思维与构造能力,但在处理复杂数学逻辑时,依然无法摆脱编造事实和逻辑断裂的幻觉困境。AI 辅助科研的潜力虽大,但缺乏可靠自纠机制的“突破”极易演变为社区狂欢下的乌龙。

2026-07-21 ~ 2026-07-23 · 11 条相关

一手来源

另有 1 条近重复转述:code_star