多款前沿AI模型在IMO 2026测试中斩获满分
近日,多款前沿AI模型在国际数学奥林匹克(IMO)测试中取得历史性突破。据实测者@deedydas公布的数据,Claude Fable 5、GPT-5.6 Sol、Kimi K3和Axiom四款模型在IMO 2026题目测试中均斩获42/42的满分成绩。这一表现标志着AI在解决高难度数学问题上的能力实现了显著飞跃。
关键细节与成本对比
@deedydas指出,这是IMO第一次被“彻底解出”。作为对比,去年表现最好的是一个未发布的Gemini Deep Think和一个OpenAI实验模型,成绩仅为35/42。而在今年的测试中,有3个公开模型仅花费10至50美元的成本就成功解出题目。此外,Claude Fable 5在解题过程中仅使用了1次尝试。测试过程未使用公开网页搜索,所有运行链接、仓库地址以及Lean证明均已开源供复现验证。
各方反应与存疑
这一突破性成绩引发了社区关注,但也伴随着对测试严谨性的审视。@deedydas强调,所有过程数据均已放在代码库中,但由于测试条件差异,实际结果可能会受到不同尝试次数的影响。转发该数据的@bdsqlsz也将其作为模型在成绩、成本与综合能力差距上的横向对比参考。
2026-07-21 ~ 2026-07-21 · 5 条相关
- 【源头】Claude Fable、GPT-5.6 Sol、Kimi K3 都拿下 IMO 2026 满分 — deedydas · 2026-07-21
- 【源头】IMO 2026 模型实测的来源与 Lean 证明链接 — deedydas · 2026-07-21
- 三款前沿模型在 IMO 题目上拿到满分 — deedydas · 2026-07-21
- 【源头】3 个公开模型据称花 10–50 美元解出 IMO,去年最佳仅 35/42 — deedydas · 2026-07-21
- 早期对比里 Kimi K3、GPT-5.6 和 Claude Fable 5 都拿满分 — bdsqlsz · 2026-07-21