OpenAI 数学成果震动学界,争议与憧憬并存
OpenAI 于 10 月 7 日前后发布数学推理相关成果(含 722 篇手稿、372 组数学结果与 722 道数学题的成绩),在数学界、AI 圈与科技媒体间引发大规模且两极分化的讨论。目前各方对结果的严格性仍持保留态度,但讨论焦点已迅速从「AI 能否做数学」转向职业与学科结构本身,值得作为观察 AI 冲击基础学科的标志性事件。
已确认
- OpenAI 高管 Mark Chen 评价 Navier-Stokes 相关结果称,这一刻的意义远超问题本身——模型一周内完成了代表数学界十年进步的工作量,并表示迫不及待要用这些工具进军生命科学、训练下一代科学家。OpenAI 研究员 Noam Brown 转引该观点并指出,LLM 已跨过一道门槛:在某些科研问题上超越了顶级人类专家,且「略低于顶尖人类」与「略高于」之间存在质的差别。
- OpenAI 研究员 Will DePue 表示惊讶:各 AI 实验室迄今公布的数学新结果尚未发现严重错误,而按人类工作常态本应预期至少出几个错;但他仍怀疑其中至少有几个经不起严格审视。
- 成果分量被分级讨论:一份被广泛转发的分析把 722 篇手稿中的已发表定理按「突破性」粗分为四档——绝大多数属于非突破性成果,其次是在既有纲领内的卓越推进,真正出乎意料的突破更少;该分析确认 OpenAI 证明了 Hodge 猜想的特例,但这尚非 LLM 最强战绩。
- 普林斯顿研究员、SWE-bench 作者 Ofir Press 判断:OpenAI 对数学做的事将在 6-18 个月内冲击编程领域,但没人能想象具体形态;他指的不是「未解难题」方向,而是模型做出人们以为要 100 年才能实现的成果。
- 研究员 Afinetheorem 通读 OpenAI 数学任务清单后称结果「疯狂到应是全球头条」,认为前沿实验室的战略第一优先级应是把这些能力迁移到医学、肿瘤学、电池效率等领域;他还批评 Wired 把这一突破报道得像反面教材,并感叹 AI 圈外的新闻业接不住这种量级的突破(@birchlse 称连 Claude 都推断这类成果理应上头版头条)。
- Reddit 讨论转述数学家 Prinz 的观点:这批结果最有趣之处不是原始解题能力,而是数学家所说的「研究品味」(research taste)——模型展现出的选题与判断直觉;HN 上的 jboggan 谈模型对 Barnette 猜想的解答时也持类似看法,认为 OpenAI 内部模型已展现数学「研究品味」,并被一些人视为通向自我改进(RSI)的关键拼图。
- 数学界反应分化:r/mathematics 社区讨论呈现明显分歧,有人惊讶于进展,也有人质疑或抵触;littmath 强烈不同意「数学史上最重要一天」的说法,认为顶多算领先指标。
- 网络统计(willdepue 用 GPT 6 Pro 与 Fable 5.1 对近三年重大数学发现排序并按发现者标注)显示 81% 来自当日发布,原推称「数学奇点本质上已实现」。博主 DrSingularity 亦感慨 2026 年 Q4 人类首次进入「几乎任何事都感觉可能」的时代。
尚未确认
- 722 道题成绩与各具体结果(含 Hodge 猜想特例)的严格正确性仍待同行检验(Will DePue 也持保留态度);「81% 重大发现」为模型辅助统计,非官方数据;「突破性四档」分级亦为社区分析而非官方定论。
- Andrew Curran 转述的分析指出,722 项成果中密码学突破「明显缺位」令人瞩目,转述者以曾见证美国政府审查学术量子密码分析结果为由,猜测存在审查干预;此说法仅为个人推测,无官方说明。
- 关于「AI 已解决数学」的说法也存在反驳:gerardsans 回应 0xIlyy 称 AI 既没解决编程也没解决数学,其有效性取决于训练数据、问题定义与验证器是否齐备。
为什么重要
- 讨论焦点迅速从「AI 能否做数学」转向职业与学科结构:Paul Novosad 指出悖论——AI 能力上可替代一个领域的所有任务,却尚未替代任何一份工作;eigenrobot 称许多数学教授默认职业是「体面的付费爱好」,直言「我们都会失业」;Grady Booch 称全球正有大量数学家深度自我怀疑。
- 物理学家 Steve Hsu 设想数学分裂为「机器数学」(海量形式验证证明、AI 消费)与「人类数学」(对机器前沿的人类化压缩)两层。banteg 与 Ethan Mollick 分别讽刺数学界将「问题」视为私有财产、以及 AI 大V集体装懂数论的现象,凸显讨论中的情绪与身份张力。
2026-10-07 ~ 2026-10-08 · 74 条相关
- 第 1 集:数学被 AI 解决了吗:观点交锋聚焦数学的开放性(2026-09-22,2 条)
- 第 2 集:OpenAI 宣称一周烧千万美元解出 Navier-Stokes 引发热议(2026-09-24,2 条)
- 第 3 集:OpenAI 拟抛数百 AI 数学证明,数学界公开分裂(2026-10-06,33 条)
- 第 4 集:开发者称 AI 找数学证明靠蛮力搜索而非深刻推理(2026-10-06,2 条)
- 第 5 集:数学家激辩AI海量论文时代同行评审存亡(2026-10-06,13 条)
- 第 6 集:传 OpenAI 耗资千万美元算力求解 Navier-Stokes 方程(2026-10-06,2 条)
- 第 7 集:OpenAI 数学成果震动学界,争议与憧憬并存(2026-10-07,74 条)
- 第 8 集:AI 三小时完成数学家毕生工作,引发教育体系质疑(2026-10-07,2 条)
- 第 9 集:AI 将扫清暴力可解数学题?圈内激辩数学未来(2026-10-07,2 条)
- 第 10 集:AI「露天开采」数学富矿:概念基建成熟处方有机会磨穿(2026-10-07,10 条)
- 第 11 集:OpenAI 再抛数百项数学成果,数学界持续震动(2026-10-08,2 条)
- 第 12 集:OpenAI 数学突破无成果发表引曼哈顿工程式猜测(2026-10-08,2 条)
一手来源
- OpenAI 高管:AI 一周走完数学十年进展,下一站生命科学 — markchen90 ·
- OpenAI 研究员惊讶:AI 实验室数学新成果至今没查出硬伤 — willdepue ·
- OpenAI 证实证明 Hodge 猜想特例,但尚非 LLM 最强战绩 — rbhar90 ·
- Ethan Mollick 讽刺:AI 大V们又集体装懂数论评点数学突破 — emollick · 2026-10-07
- OpenAI 新发布震动数学界,「超人类数学家」时代或提前到来 — Singularitarian · 2026-10-07
- Steve Hsu:AI 单日产出数学或超人类百年消化的极限 — CatAstro_Piyush · 2026-10-07
- 【源头】OpenAI 研究员惊讶:AI 实验室数学新成果至今没查出硬伤 — willdepue · 2026-10-07
- 研究员:OpenAI 数学成绩若属实,实验室应优先推广到医学与电池 — Afinetheorem · 2026-10-07
- 数学家 littmath:OpenAI 这次还不算数学史上最重要的一天 — littmath · 2026-10-07
- 研究者:2030 年前 AI 或解决多数可计算的开放科学问题 — Afinetheorem · 2026-10-07
- 研究者预测:2030 年前 AI 将解决多数可计算的科学开放问题 — Afinetheorem · 2026-10-07
- 「AI 已解决数学」引争议:数学即世界论遭反驳 — 0xIlyy · 2026-10-07
- 数学家为 OpenAI 新推理模型落泪:从算术到攻克数十年难题 — daniel_mac8 · 2026-10-07
- Elliot Glazer:OpenAI 发布及格,但此前传闻几乎全被证伪 — ctjlewis · 2026-10-07
- 有人估算某 AI 数学成果相当于非顶级数学家十年总产出 — joejanizek · 2026-10-07
- OpenAI 攻克数学,却一个工作也没替代——反讽式观察引热议 — paulnovosad · 2026-10-07
- OpenAI Astra 证明非sofic群只花 2000 美元 token,数学家发文激愤呼吁抵制合作 — andy_matuschak · 2026-10-07
- AI 解出奥数级难题,「随机鹦鹉」论者被打脸的梗图时刻 — itsmnjn · 2026-10-07
- 「随机鹦鹉论」破产后,看空 LLM 的声音去哪了 — itsmnjn · 2026-10-07
- o1 时刻重演?LLM 意识之争再起,作者称不可妄下断言 — itsmnjn · 2026-10-07
- 研究员炮轰 Wired:把史上最大数学突破报道得像反面教材 — Afinetheorem · 2026-10-07
- 程序员已成赛博格,数学家还在为AI抢 conjecture 哭闹 — banteg · 2026-10-07
- Ofir Press:OpenAI 震动数学界的时刻将在 6-18 个月波及编程 — OfirPress · 2026-10-07
- Ofir Press:超人类阶段下,好的编程基准会越来越难做 — OfirPress · 2026-10-07
- OpenAI 数学时刻将冲击编程:研究员预测 6-18 个月内显现 — mark_attar · 2026-10-07
- OpenAI 数学成果缺密码学:研究者呼吁可证明困难问题 — thomasahle · 2026-10-07
- 网友统计:近三年 81% 重大数学发现由 OpenAI 今日一次发布 — mtizard · 2026-10-07
- Grady Booch 转述专家热议:AI 数学求解是突破还是对数学家的 DDoS — Grady_Booch · 2026-10-07
- 数学家争论 AI 数学产出估算:难题早已被充分形式化 — _onionesque · 2026-10-07
- Grady Booch:全球正陷入深度自我怀疑的数学家为数不少 — Grady_Booch · 2026-10-07
- OpenAI 称解出数百道数学题,数学界呼吁独立验证 — Ghost_Pilot_MD · 2026-10-07
- AI 求解数学题「90 道证明」曲线遭质疑:缺少预注册,前 30 道去哪了 — allTheYud · 2026-10-07
- AI 界「随机鹦鹉」怀疑派去哪了?大模型成功后集体沉默 — basedjensen · 2026-10-07
- 研究者叹 OAI 数学成果遭媒体冷处理:AI 圈外的新闻业接不住这种突破 — dioscuri · 2026-10-07
- OpenAI 数学证明发布后,r/mathematics 社区反应两极 — petburiraja · 2026-10-07
- OpenAI「数学大爆炸」次日,纽约时报头版竟只字未提 — joshgans · 2026-10-07
- 梗图:随机鹦鹉解开所有数学题后,数学家们的表情 — soumitrashukla9 · 2026-10-07
- 评论称 OpenAI 数学成果标志人类让位 AI 的可验证领域又添一个 — inductionheads · 2026-10-07
- OpenAI 模型连解 722 道数学题轰动 AI 圈,BBC 首页却在报道甜点回潮 — david_stillwell · 2026-10-07
- math AI 里程碑之争:有人称史上最重要,研究者异议称 GPT-3 才是起点 — giffmana · 2026-10-07
- 【源头】OpenAI 证实证明 Hodge 猜想特例,但尚非 LLM 最强战绩 — rbhar90 · 2026-10-07
- OpenAI 横扫数学题引发吐槽:数学教授的职业溢价还剩多少 — nptacek · 2026-10-07
- Q4 2026 网友感慨:AI 重大突破频出,「一切皆有可能」时代来临 — Dr_Singularity · 2026-10-07
- OpenAI 新模型连剂数学开放难题,学者称缺预注册致曲线失真 — Jsevillamol · 2026-10-07
- 「AI 数学进展慢」之争:反驳称缺预注册才显得慢,90 题已解属实 — Jsevillamol · 2026-10-07
- 数学家们刚被 AI 拿下?OpenAI 梗图速览 — AvivTamar1 · 2026-10-07
- 老牌研究者批 OpenAI 数学论文:图表稀缺且流于平庸 — prof_g · 2026-10-07
- OpenAI 内部模型展露数学「研究品味」,数学家惊叹其自创新技巧 — aran_nayebi · 2026-10-07
- 经济学家评 OpenAI 数学日:或迎按需生产数学知识的时代 — joshgans · 2026-10-07
- Jack Rae 谈 OpenAI 数学突破:指数曲线未停,世界级解题已提前实现 — jack_w_rae · 2026-10-08