Claude Fable、GPT-5.6 Sol、Kimi K3 都拿下 IMO 2026 满分
deedydas · x · 2026-07-21
作者拿 Claude Fable、GPT-5.6 Sol、Kimi K3 和 Axiom 跑了 2026 IMO,结果四个都拿到 42/42 满分。
- Claude Fable 5 只用 1 次尝试 就解出,且总耗时最快,约 2.5 小时。
- GPT-5.6 Sol 只多了 1 次尝试,但在这组里最省钱。
- Kimi K3 也解出来了,但重试更多、token 消耗也明显更高。
- Axiom Math 则把证明正式落在了 Lean 里。
配图里的统计还显示,P3 和 P6 是最难的两题,按尝试次数和 token 都最重。作者的结论是:AI 的前沿已经明显越过 IMO 数学。
所属事件:多款前沿AI模型在IMO 2026测试中斩获满分(6 条相关)→
「模型」频道最新
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27
- Gemini 3.6 Flash 被看作能以低成本打 Sonnet 质量 — haider1 · 2026-07-27