IMO 2026 七模型横评:Claude Fable 5 等三模型满分,成本最低 20 美元

新智元 · wechat · 2026-07-22

前 Google 工程师 DeedyDas 对 7 个前沿大模型进行 IMO 2026 全 6 题自主测试。Claude Fable 5、GPT-5.6 Sol (xhigh)、Kimi K3 均获满分 42 分,Axiom Prover 同样满分。Claude 耗时 2.5 小时、成本 51 美元;GPT 耗时 3.8 小时、成本 20 美元;Kimi 耗时 17.4 小时、成本 31 美元。作为对比,人类选手过去七年满分率仅 0.69%。文章详细分析了各模型解题策略:Claude 定义计数器 Φ=T+N 证明终止;GPT 用乘积与个数字典序降维;Kimi 采用暴力搜索。P6 压轴题仅 6 名人类解出,三个模型均满分。Grok 4.5 因 agent 幻觉未完成。测试由 AxiomMath 提供 Lean4 形式化题面,其创始人洪乐彤年仅 25 岁,公司估值 16 亿美元。

所属事件:多款前沿AI模型在IMO 2026测试中斩获满分(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →