68道Erdős公开难题做基准:GPT-6 Astra仅解3%,其余全零分
chaumian · x · 2026-09-23
Epoch AI 与曼彻斯特大学发布 FrontierMath Erdős(FME) 基准,从 Erdős 的 652 个公开难题中选出 68 个截至 2026 年 8 月仍未解决 的猜想,要求 AI 系统在 Lean 证明助手中给出证明或反驳。
评测设定:所有模型面对同一组固定问题,自主运行且每题预算 300 美元。结果五个受测 AI 中,仅 GPT-6 Astra 得分 3%,其余全部 0%。作者指出,此前 AI 解决个别公开数学问题的演示缺乏系统性,FME 提供了统一、可复现的能力检验标准。
「模型」频道最新
- 网友晒 Claude Opus 5.5 独立完成代码审查,「抢了 Theo 的活」 — 0xkarasy · 2026-09-23
- Sarvam 语音模型 Saaras V4 新增 keyterm 提示提升转写准确率 — cneuralnetwork · 2026-09-23
- 小米 MiMo V2.6 Pro 登顶开源榜,成本低至每任务约 $0.13 — heyshrutimishra · 2026-09-23
- 小米 MiMo V2.6 Pro 登顶全球开源模型榜,单任务成本约 $0.13 — heyshrutimishra · 2026-09-23
- 用户深挖 Muse 智能体:可发 IG 私信、控制智能家居甚至自建邮箱 — flaneur451 · 2026-09-23
- Yacine 吐槽:中国 RL 模型登顶背后只是 on-policy 合成数据 — yacineMTB · 2026-09-23