GPT-5.6连破历史数学难题,证明能力大幅提升
近期,OpenAI 的 GPT-5.6(或称 GPT-5.6 Sol)在高级数学证明领域展现出惊人实力,接连攻克多个历史难题,引发了 AI 圈与数学界的广泛关注。该模型不仅能生成非平凡的数学证明,在特定基准测试中成绩大幅提升,还展现出利用并行智能体加速推导的潜力。
连破历史数学难题
GPT-5.6 最引人注目的成绩是解决了悬置近 70 年的埃尔德什 119 号猜想(Erdős #119)。据 @SebastienBubeck 和 @burny_tech 等人转述,该模型在 Korsky 的提示下,仅用了一页纸的篇幅和标准的调和分析技巧就完成了证明,超越了此前 Beck 在 1991 年发表的 44 页《Annals》论文。此外,据 @Charuru 反馈,在 OpenAI 发布相关公告后,GPT-5.6 还推进了一个凸优化问题,补上了长达 30 年的空白,且该证明已在 Lean 形式化语言中得到验证。@cloneofsimo 也感叹模型解决了太多十年前的问题,并提及它在 Luce permutations 上的数学结果。数学家 Thomas F. Bloom(经 @AlexKontorovich 转发)也表示,自己详细检查过的新证明主张都成立,认为该模型极具“数学味”。
测试成绩与能力对比
在包含 226 个问题的数学基准测试中,GPT-5.6 展现了比前代 GPT-5.5 更果断的推理和更严谨的证明。分析显示,GPT-5.5 仅获得 27 个 A 级,而 GPT-5.6 的成绩分布显著优化。微软 CEO Mikhail Parakhin(@MParakhin)也评价了其数学能力,指出 GPT-5.6 在数学研究上明显优于 Fable(尤其是 Pro 版),但整体仍未达到曾经的 GPT-5.2 Pro 水平。
推理机制与提示词技巧
GPT-5.6 的爆发引发了对背后机制的探讨。@airkatakana 质疑其表现是因为 OpenAI 给了更多 token 还是模型本身能力增强,并指向了推理预训练。此外,有用户分享了引导模型解题的技巧:当模型卡壳时,让它先寻找“能推出该猜想的最弱命题”,这种改写能有效引导模型找到可行论证路径。@新智元 的报道还补充,该模型能在不到 1 小时内通过 64 个子智能体并行给出 Cycle 相关证明。
2026-07-18 ~ 2026-07-20 · 10 条相关
- 第 1 集:Polymarket押注GPT-5.6将在7月7日前发布(2026-07-03,8 条)
- 第 2 集:GPT 5.6 属 Opus 级,比 Opus 4.8 更便宜更快(2026-07-04,3 条)
- 第 3 集:OpenAI GPT-5.6发布传闻集中升温(2026-07-05,17 条)
- 第 4 集:网传GPT-5.6发现新数学,消息未获证实(2026-07-06,2 条)
- 第 5 集:马斯克宣布Grok 4.5发布,参数达1.5万亿(2026-07-07,25 条)
- 第 6 集:预测市场高度押注Grok 4.4近期发布(2026-07-07,2 条)
- 第 7 集:OpenAI官宣GPT-5.6 Sol周四发布,早期反馈能力大幅跃升(2026-07-07,58 条)
- 第 8 集:OpenAI发布新一代语音模型GPT-Live(2026-07-07,44 条)
- 第 9 集:Grok 4.5 发布主打低成本与高编码性能(2026-07-08,61 条)
- 第 10 集:ChatGPT 新版语音模式实测:多语言表现逼近真人(2026-07-09,14 条)
- 第 11 集:GPT-5.6 实测:自主编码跃升,全面对标 Fable 5(2026-07-09,30 条)
- 第 12 集:xAI发布Grok 4.5主打编程与智能体(2026-07-09,55 条)
- 第 13 集:Grok 4.5 跑分受 Cursor 代码库泄露影响(2026-07-09,6 条)
- 第 14 集:社区疯传多款 AI 模型即将密集发布(2026-07-09,2 条)
- 第 15 集:Grok 4.5 发布获大量好评:速度快、编码强(2026-07-09,13 条)
- 第 16 集:Grok 4.5 因处理速度与整体表现获好评(2026-07-09,2 条)
- 第 17 集:编码实测:Grok 4.5速度与上下文消耗均优于Fable(2026-07-09,3 条)
- 第 18 集:Grok 4.5发布并登上Vals榜单第六名(2026-07-09,2 条)
- 第 19 集:前沿模型横评:GPT-5.6 性价比与创造力获好评(2026-07-09,3 条)
- 第 20 集:OpenAI 发布 GPT-5.6 系列:主打多智能体与极致性价比(2026-07-09,119 条)
- 【源头】GPT-5.6在Lean里补上凸优化证明 — Charuru · 2026-07-18
- 【源头】GPT 5.6 号称解出70年猜想 — burny_tech · 2026-07-19
- GPT-5.6 数学表现引发讨论 — airkatakana · 2026-07-19
- 数学家称 GPT 5.6 Sol 证明表现出色 — AlexKontorovich · 2026-07-19
- 用更弱命题引导 GPT 5.6 证明 — burny_tech · 2026-07-19
- 【源头】GPT 证明出更强数学结果 — SebastienBubeck · 2026-07-19
- GPT 5.6 又在整活 — cloneofsimo · 2026-07-20
- GPT-5.6在数学基准测试中表现大幅提升 — burny_tech · 2026-07-20
- Parakhin评GPT-5.6数学能力:优于Fable但不及5.2 Pro — MParakhin · 2026-07-20
- GPT-5.6连解多道埃尔德什数学难题 — 新智元 · 2026-07-20