专题 · FULL STORY

OpenAI连破数学难题:从传闻到学界震动

7月末起网传OpenAI模型证明非sofic群、解决多个开放数学难题,初期真伪存疑。随后埃尔德什猜想被推翻、反例与Lean证明接连得到验证,陶哲轩警示「证明过剩」,数学界在震动与炒作争议中反思AI超人类时代的到来。

2026-07-29 ~ 2026-08-18 · 12 集 · 79 条

第 1 集 · AI数学验证成瓶颈,人类理解不可或缺(2026-07-29,5 条)

随着大模型在数学领域的应用加深,生成结果容易但验证难成为核心瓶颈。Matt Green、Alexander Kalian 等专家指出,AI 擅长生成看似合理但实则有误的内容,而复杂证明往往耗时良久才能完成形式化验证。因此,人类对数学的“消化”与理解依然不可或缺。

已确认

  • 验证成为核心瓶颈:Matt Green 指出,当前模型擅长生成外表像样但实际错误的“结果垃圾”,真正的难点在于验证结果本身是否正确。
  • 形式化验证耗时极长:研究员 Alexander Kalian 探讨了使用大模型解决数学开放问题的局限,强调即使是学术界产出的复杂证明,往往也需要数年才能完成形式化验证。
  • 特定领域的伪证风险:Matt Green 补充,虽然公开的数学结果多可通过机器检查反例来验证,但在非实用密码学分析等领域,极易产生难以察觉的伪证。

尚未确认

  • 巨型证明的隐患:@rbhar90 提出质疑,如果 AI 生成了人类无法理解的大型证明,其内核本身可能存在隐藏的错误,这种风险目前难以评估。

为什么重要

  • 人类理解不可或缺:@rbhar90 认为,数学需要被人类“消化”,这并非人类中心主义,而是确保证明准确性的必要环节。
  • 强 AI 的终极应对:Matt Green 认为,面对极强的 AI,人类目前的唯一安慰是大家最终都会“同舟共济”,必须共同寻找应对机制,而不是单纯依赖被形容为“聪明的塑料朋友”的 AI 来解决所有问题。

第 2 集 · LLM连破数学猜想引发学界精神危机(2026-07-31,5 条)

近期大语言模型(LLM)成功找到多个长期未解重大数学猜想的反例,在数学界引发强烈震动与深层的“精神危机”。这一突破促使学界反思数学研究的本质与数学家的未来角色,并引发了对人类固有认知直觉的探讨。

已确认

  • LLM 在近期接连对多个长期数学猜想给出了反例。
  • 作者 Kirwin Hampshire 撰文表达了内心的绝望与反思,指出数学家的传统角色正受到威胁。
  • Hampshire 在文章中批评了《莱顿宣言》,认为其回避了 AI 冲击带来的核心问题。
  • Polymarket 的研究消息也指出,AI 正在解决越来越多的长期未解难题,导致数学领域发生迅速且令人不安的变化。

为什么重要

  • 这一连串突破不仅是技术上的里程碑,更直接冲击了人类学者的精神信仰与职业价值。正如 yeastsplainer 所述,AI 揭示出的深层且奇异的数学结构,正在颠覆人类长期以来对平滑性和秩序的偏好与直觉。它迫使数学界重新审视:即使 AI 能高效证明定理,人类在未来数学研究中的定位究竟在哪里。

第 3 集 · 网传OpenAI证明非sofic群被指伪造(2026-08-01,5 条)

近日网络流传一张截图,称 OpenAI 完成了首个非 sofic 群(nonsofic group)的构造,引发广泛关注。该消息已被多方指出大概率是高水平伪造的“整活”内容,并非真实的数学突破。

已确认

  • 网络流传一张不完整截图,戏称 OpenAI 证明了非 sofic 群的存在,并调侃 GPT 5.6 正在取代数学家。
  • 截图被指大概率是伪造内容。网友 @spikedoanz 指出,虽然截图中每句话单看都合乎逻辑,但通篇并未提出任何实质性的证明过程。
  • 有用户(如 @Sauers)受此启发,尝试让 AI 解决数学证明,并发现 AI 展现了处理高难度抽象数学逻辑的潜力,同时也迫使用户去查阅陌生的数学概念。

尚未确认

  • 泄露论文的真实性已被基本推翻。此前爆料曾称论文作者 Elliot Glazer 是 FrontierMath 创始人,以此增加可信度,但该信息随伪造定论而失去意义。

为什么重要

  • 这一乌龙事件反映了当前 AI 生成内容的高迷惑性。即便是在高度专业的抽象数学领域,结构严谨但缺乏实质的伪造内容依然能引发公众误解。
  • 同时,这也折射出公众对 AI 前沿数学推理能力的高度关注与期待。

第 4 集 · AI挑战千禧年数学难题未果(2026-08-01,2 条)

近期,研究人员尝试利用大语言模型结合增加测试期计算的方法来攻克千禧年大奖难题。尽管目前尚未成功解开任何重大数学问题,且每个问题投入的算力相对有限,但研究者指出未来在挖掘测试期算力方面仍有极大提升空间。同时,学者Noam等人呼吁公开此类失败经验,以避免研究界的重复劳动。

第 5 集 · 前沿大模型成功证明非sofic群存在(2026-08-01,2 条)

近期,前沿大模型在高级数学证明领域取得新突破,成功证明了非sofic群的存在。具体而言,AI模型Sol 5.6仅耗时34分钟便提出了有效证明,另一模型Fable也在接近5小时的会话限制内成功完成了证明。这一进展展示了大模型在解决复杂数学问题上的巨大潜力,相关研究论文也即将正式发布。

第 6 集 · AI数学能力紧追编程,有望攻克菲尔兹奖级难题(2026-08-02,3 条)

近期多位从业者指出,AI在数学领域的进展正紧随编程能力的突破,尽管存在一定延迟。目前AI虽未在整体开发能力上超越人类,但在特定任务上表现极佳,堪称强大的生产力倍增器。有观点认为,解决开放性数学难题远比生成网站或游戏更考验真正的智能,也更贴近超级智能的范畴。按此演进速度,菲尔兹奖级别的数学难题或将在未来一两年内被AI攻克,使其成为顶级学者的超强副手。

第 7 集 · OpenAI 数学突破震动学界(2026-08-02,19 条)

本簇讨论围绕一则在数学与 AI 圈迅速发酵的消息:多条帖子称,OpenAI 一款未发布模型已解决 10 个开放性数学难题,并在若干长期猜想上给出反例,范围还涉及理论计算机科学。尽管材料里没有原始论文或技术细节,这一说法已足以引发对数学家职业前景、研究组织方式,以及“人类还能否评估前沿 AI 证明”的集中反思。当前真正的分歧不在于它是否震撼,而在于这些题目的实际难度和突破性质是否被高估。

已确认

  • 多条帖子围绕同一结果展开,核心表述包括“解决 10 个开放性数学难题”“攻克至少十年未解的问题”以及“为多个长期猜想找到反例”。
  • @matthewdgreen 转述 Divesh Aggarwal 的评价称,如果这项结果成立,放在其他年份足以达到 STOC/FOCS 级别的最佳论文竞争力。
  • @ctjlewis、@thomasahle、@silvertsuki、@chaumian 和 @imjustnewatai 都描述了数学界的心理与职业冲击:当证明定理被视为数学家的核心价值时,AI 的推进威胁的不只是具体工作内容,也包括研究者的意义感与持续投入的动力。
  • @skdh 关注的是研究机制层面的变化:LLM 的高速跨领域猜想能力,可能打破现代数学依赖高度细分、缓慢交流来维持秩序的“孤岛式”生产方式。
  • @zetalyrae 提出两层更激进的判断:其一,认为“人类负责方向、教学或筛选”这类安慰性说法未必站得住脚;其二,随着 AI 在数学上继续跃迁,人类顶尖专家可能逐渐不再足以验证最前沿证明,这会形成评估超级智能的悖论。
  • 也有相对乐观的声音。@littmath 认为数学家的价值不会消失,而是会被推向更高层次的未知问题;@HZoete 则把未来使命概括为让强大的 AI 推理保持可理解、可驾驭,并帮助人类解决长期悬而未决的难题。

尚未确认

  • @msfeldstein 援引 Nate Silver 的质疑称,这些成果也可能并非“革命性突破”,而是解决了此前没有太多人愿意投入时间的相对简单开放问题。
  • 现有材料并未提供 OpenAI 的一手公告、具体题目清单或证明细节,因此无法仅凭本簇独立核实每道题的难度、原创性与学术分量。

为什么重要

  • 这场讨论触及的不只是一次模型能力展示,而是数学研究的社会分工:如果机器能够稳定地产出高质量证明或反例,人类数学家的独特角色需要如何重写。
  • 它也暴露出 AI 治理上的新难题。当前沿数学推理开始超出多数专家的可验证范围时,系统的可解释性、可信评估与控制问题会变得更加尖锐。

第 8 集 · AI数学突破引热议:奇点已至还是规律使然?(2026-08-03,5 条)

近期AI在高级数学推理上的突破引发社区热议,斯坦福数论学家Jared Duker Lichtman提出“每小时看新闻”的奇点标准,开发者danielmac8总结乐观共识称奇点已至、有效算力即智能,并预测GPT-6等更强模型即将问世。从GPT-2/3时代连小学算术都不稳定,到如今能解决最高水平数学问题,这种进步速度让用户mobav0和andrewncarr感到“超现实”,认为根本限制正在消失,模型越来越不像“统计鹦鹉”。

已确认

  • 斯坦福大学数论学家Jared Duker Lichtman提出判断奇点的直观标准:当你必须每小时查看一次新闻以跟上AI的突破时,就意味着奇点已经到来。他强调AI正在以前所未有的速度重塑数学领域。
  • 开发者danielmac8总结了圈内乐观共识:奇点已经到来,有效算力等同于智能,并预测GPT-6等更强模型即将问世。
  • 用户mobav0与andrewncarr均指出,从GPT-2/3时代连小学算术都不稳定,到如今能解决最高水平的数学问题,这种进步速度让人感觉“超现实”。mobav0提及高规模强化学习等进展,以及Glasswing和Hugging Face事件增加了紧迫感。

尚未确认

  • 奇点是否真正到来仍属主观判断与社区情绪。博主doodlestein提供了基于Scaling Law的理性视角,认为这种从GPT-4开始碾压前代的能力跃升,完全符合对数线性规律的外推。这种飞跃并非不可预测,因此无需过度神化。

为什么重要

  • AI在数学等严密逻辑推理领域的突破,是衡量其智能水平的重要标尺。这场讨论不仅反映了业界对大模型能力跃升的惊叹,也折射出面对技术爆炸时,社区在“技术奇点论”与“科学缩放规律”之间产生的认知碰撞。

第 9 集 · OpenAI新模型攻克经典数学难题引热议(2026-08-04,3 条)

据报道,OpenAI内部模型成功找到了数学家保罗·埃尔德什在1940年代提出的经典难题解法,展现出超人类的文献整合能力。AI仅用一小时便解决了数学家苦干十年的难题,这一突破性进展被Quanta Magazine称为AI领域的相变时刻。有观点认为,AI的强力介入可能标志着数学研究英雄时代的终结。

第 10 集 · AI连破数学难题,陶哲轩警示证明过剩时代(2026-08-06,13 条)

近期AI在数学领域取得密集突破,包括推翻悬置80年的埃尔德什单位距离猜想、找到雅可比猜想反例,以及Astra系统产出十项可验证的Lean证明。顶尖数学家陶哲轩指出,随着机器生成可验证证明的速度加快,数学研究正走向“证明过剩”时代,人类可能很快面临无法及时理解这些证明的困境。这些进展标志着数学研究正从“证明稀缺”迈向“证明过剩”时代,但也引发了学界对人类认知价值、理解能力以及AI数学研究瓶颈的深刻反思。

已确认

  • AI近期在数学界取得显著进展,OpenAI与Anthropic的内部模型在离散几何等领域展现出强大能力,Astra系统产出了十项转化为Lean语言供计算机验证的数学进展。
  • 顶尖数学家陶哲轩指出,随着机器生成可验证证明的速度加快,数学研究正走向“证明过剩”时代,人类可能很快面临无法及时理解这些证明的困境。
  • 学界正积极探讨应对冲击的策略,@TimothyDuignan呼吁数学家全力以赴确保AI带来的理论成果能够顺利落地应用。

尚未确认

  • @JacobHHilton曾预测超人类数学AI将在2020年代末或2030年代初出现,但他现在认为可能低估了进展速度,假设未来十年内AI有望在所有数学任务上远超人类。
  • 尽管@ShayneRedford认为当前成果令人激动且只是巨大技术浪潮的开端,但现在宣告数学已被彻底攻克还为时尚早。

为什么重要

  • 认知价值与能力危机:@littmath指出,数学界对AI突破产生的焦虑并非单纯出于失去解题特权,而是涉及更深层的认知价值危机。他担忧,如果人类逐渐丧失理解高深数学的能力和由好奇心驱动的研究意愿,可能会在主观上拒绝实现数学研究的自动化。
  • AI的能力短板:@JFPuget认为,尽管AI能通过Lean验证已知猜想的证明,但目前缺乏自动化方法来判断一个新猜想是否具有真正的数学价值。提出有价值猜想背后的前置工作仍是AI在数学领域发挥更大作用的瓶颈。
  • 理论构建的新纪元:@profg强调,AI Agent时代已经来临,这将推动数学研究进入理论构建的新纪元。

第 11 集 · 数学家Litt详述AI超人类时代数学界冲击与炒作警示(2026-08-11,15 条)

数学家 Daniel Litt 在参加 OpenAI 举办的「数学未来」闭门峰会后,系统推演了当 AI 在数学领域达到稳健的超人类水平时,学术界将面临的深远冲击。会议直接将「AI 能解决所有人类可解之题」作为公理前提。Litt 警告称,尽管 AI 能高效修复文献漏洞,但也将严重破坏现有的学术激励与交流生态。与此同时,多位学者联合呼吁,应警惕社交媒体对所谓 AI 数学「突破」的盲目炒作。

已确认

  • 交流生态受损:Litt 指出,由于模型能根据少数核心思路重构整篇论文,学者们因害怕被抢功而拒绝公开讨论未发表的研究,导致数学界陷入囚徒困境。他引用数据称,数学问答社区 MathOverflow 的活跃度自 2025 年初起出现断崖式下跌,很大程度上归咎于 AI 的冲击。
  • 学术激励扭曲:Litt 认为,在现有体制下,利用 Codex 等工具像玩「老虎机」一样批量刷论文将成为职业成功的「主导策略」。大量重复性证明的边际价值极低,其实际价值仅相当于消耗的 Token 成本。
  • 研究同质化:前沿模型正出现扎堆证明相同猜想的现象。例如,有三个独立团队几乎同时给出了 Feige 1/e 猜想高度相似的证明;在有人公布 Jacobi 猜想的反例后,OpenAI 的内部模型也迅速跟进给出了类似反例。

尚未确认

  • 未来预测与人类角色转变:Litt 推测到 2028 年 AI 自动形式化将变得廉价高效,到 2029 年 AI 将全面接管理论构建与提出猜想的工作,人类可能转变为指挥算力的「实验室科学家」。这些是基于当前趋势的推演,而非既定事实。

为什么重要

  • 警惕炒作与利益相关:学者 Gautam Kamath 指出,大众在社交媒体上评估 AI 数学成果时往往只能依赖「问题存在的时间长短」和「发布者的炒作程度」,这并非衡量研究质量的可靠指标。数学成果的实际重要性必须由该领域的数学家来评判,而不是靠 AI 给自己「改作业」来定论。
  • 宏观视角的反思:尽管 Litt 深刻担忧学术生态,他也坦言,随着高能力模型在未来几年引发超越抽象数学领域的巨大社会动荡,这些学术界的烦恼可能显得微不足道。但他仍对数学能够生存和繁荣持广泛乐观的态度。

第 12 集 · OpenAI 借 AI 推翻埃尔德什猜想并连解多项数学难题(2026-08-17,2 条)

据 Peter Diamandis 等介绍,OpenAI 于 5 月利用 AI 生成了对埃尔德什猜想(提出已 80 年)的反驳证明,并发现此前未被构想的反例,这是 AI 首次产出具有历史意义的数学证明。到 8 月,OpenAI 已发表 10 项解决或推进长期数学难题的新成果,被视为 AI 正在重塑数学研究方式的标志性进展,相关模型尚未公开。