GPT-5.6连破历史数学难题,证明能力大幅提升

近期,OpenAI 的 GPT-5.6(或称 GPT-5.6 Sol)在高级数学证明领域展现出惊人实力,接连攻克多个历史难题,引发了 AI 圈与数学界的广泛关注。该模型不仅能生成非平凡的数学证明,在特定基准测试中成绩大幅提升,还展现出利用并行智能体加速推导的潜力。

连破历史数学难题

GPT-5.6 最引人注目的成绩是解决了悬置近 70 年的埃尔德什 119 号猜想(Erdős #119)。据 @SebastienBubeck 和 @burny_tech 等人转述,该模型在 Korsky 的提示下,仅用了一页纸的篇幅和标准的调和分析技巧就完成了证明,超越了此前 Beck 在 1991 年发表的 44 页《Annals》论文。此外,据 @Charuru 反馈,在 OpenAI 发布相关公告后,GPT-5.6 还推进了一个凸优化问题,补上了长达 30 年的空白,且该证明已在 Lean 形式化语言中得到验证。@cloneofsimo 也感叹模型解决了太多十年前的问题,并提及它在 Luce permutations 上的数学结果。数学家 Thomas F. Bloom(经 @AlexKontorovich 转发)也表示,自己详细检查过的新证明主张都成立,认为该模型极具“数学味”。

测试成绩与能力对比

在包含 226 个问题的数学基准测试中,GPT-5.6 展现了比前代 GPT-5.5 更果断的推理和更严谨的证明。分析显示,GPT-5.5 仅获得 27 个 A 级,而 GPT-5.6 的成绩分布显著优化。微软 CEO Mikhail Parakhin(@MParakhin)也评价了其数学能力,指出 GPT-5.6 在数学研究上明显优于 Fable(尤其是 Pro 版),但整体仍未达到曾经的 GPT-5.2 Pro 水平。

推理机制与提示词技巧

GPT-5.6 的爆发引发了对背后机制的探讨。@airkatakana 质疑其表现是因为 OpenAI 给了更多 token 还是模型本身能力增强,并指向了推理预训练。此外,有用户分享了引导模型解题的技巧:当模型卡壳时,让它先寻找“能推出该猜想的最弱命题”,这种改写能有效引导模型找到可行论证路径。@新智元 的报道还补充,该模型能在不到 1 小时内通过 64 个子智能体并行给出 Cycle 相关证明。

2026-07-18 ~ 2026-07-20 · 10 条相关

事件全程(共 20 集)→