多款前沿AI模型在IMO 2026测试中斩获满分

近日,多款前沿AI模型在国际数学奥林匹克(IMO)测试中取得历史性突破。据实测者@deedydas公布的数据,Claude Fable 5、GPT-5.6 Sol、Kimi K3和Axiom四款模型在IMO 2026题目测试中均斩获42/42的满分成绩。这一表现标志着AI在解决高难度数学问题上的能力实现了显著飞跃。

关键细节与成本对比

@deedydas指出,这是IMO第一次被“彻底解出”。作为对比,去年表现最好的是一个未发布的Gemini Deep Think和一个OpenAI实验模型,成绩仅为35/42。而在今年的测试中,有3个公开模型仅花费10至50美元的成本就成功解出题目。此外,Claude Fable 5在解题过程中仅使用了1次尝试。测试过程未使用公开网页搜索,所有运行链接、仓库地址以及Lean证明均已开源供复现验证。

各方反应与存疑

这一突破性成绩引发了社区关注,但也伴随着对测试严谨性的审视。@deedydas强调,所有过程数据均已放在代码库中,但由于测试条件差异,实际结果可能会受到不同尝试次数的影响。转发该数据的@bdsqlsz也将其作为模型在成绩、成本与综合能力差距上的横向对比参考。

2026-07-21 ~ 2026-07-21 · 5 条相关