IMO 2026 七模型横评:Claude Fable 5 等三模型满分,成本最低 20 美元
新智元 · wechat · 2026-07-22
前 Google 工程师 DeedyDas 对 7 个前沿大模型进行 IMO 2026 全 6 题自主测试。Claude Fable 5、GPT-5.6 Sol (xhigh)、Kimi K3 均获满分 42 分,Axiom Prover 同样满分。Claude 耗时 2.5 小时、成本 51 美元;GPT 耗时 3.8 小时、成本 20 美元;Kimi 耗时 17.4 小时、成本 31 美元。作为对比,人类选手过去七年满分率仅 0.69%。文章详细分析了各模型解题策略:Claude 定义计数器 Φ=T+N 证明终止;GPT 用乘积与个数字典序降维;Kimi 采用暴力搜索。P6 压轴题仅 6 名人类解出,三个模型均满分。Grok 4.5 因 agent 幻觉未完成。测试由 AxiomMath 提供 Lean4 形式化题面,其创始人洪乐彤年仅 25 岁,公司估值 16 亿美元。
所属事件:多款前沿AI模型在IMO 2026测试中斩获满分(6 条相关)→
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11