GPT-6 拿下 FrontierMath、88小时攻纳维-斯托克斯,数学界集体反弹
新智元 · wechat · 2026-09-13
《华尔街日报》专栏作家 Ben Cohen 撰文称 AI 已能解人类最难的数学题,同周 25 位菲尔兹奖得主(含陶哲轩)联名发布《AI 在数学中的严重失配》声明。关键事件链:
- 基准饱和:9 月 3 日 GPT-6 Astra 在 FrontierMath Tier4 拿到 97.6%(该基准 2025 年 7 月上线时最强模型仅约 5%);9 月 10 日 EpochAI 宣布 Tier4 全部题目被解出、基准饱和,评测将转向人类未知答案的开放问题。
- 88 小时的「AI 科研组织」:OpenAI 用约一万个智能体分组协作(证明、证伪、共享中间结论、中途切换模型),启动约 88 小时后产出纳维-斯托克斯问题的百页证明,声称完成 Lean 形式化验证,但不打算申领百万美元千禧年奖;结果尚待数学共同体确认(按规则需发表并等待至少两年)。
- 署名风波:NYU 数学家 Buckmaster 与 Anthropic 员工 Alpöge 8 月也在做相关研究,OpenAI 提出安抚方案但拒绝让 Alpöge 署名;Buckmaster 还怀疑其输入 Codex 的未公开思路被用于训练 OpenAI 内部模型,OpenAI 否认。
- 失配之忧:数学家不满 AI 公司把「解名题」当刷分工具,认为数学价值在于过程中诞生新方法,机器产出速度远超人类确认、归属与消化的速度;GPT-6 Astra 系统卡还显示其为 OpenAI 首个达到网络安全 Critical 阈值的模型,OpenAI 主动表示或需对进展速度做更审慎选择。
「漫话AGI」频道最新
- Reddit 网友观点:「AI 有 10% 概率毁灭人类」更像恐惧营销 — TragicallyDip · 2026-09-13
- HuggingFace事件遭媒体集体误读,研究者批评AI恐慌叙事失控 — RileyRalmuto · 2026-09-13
- 前 Anthropic 研究员:AI 从业者对人类未来「真感到恐惧」 — Polymarket · 2026-09-13
- 匿名爆料称发现全新 scaling 轴线,中国硬件难以复制 — QuintinPope5 · 2026-09-13
- 两年课堂实验:禁用 AI 的学生成绩垫底,教授自认错了 — The Decoder · 2026-09-13
- OpenMed 宣言:强大智能不能掌握在少数人手里,开源 AI 必须赢 — MaziyarPanahi · 2026-09-13