发布仅 14 个月,FrontierMath Tier 4 全部研究级数学题已被 AI 解完
Afinetheorem · x · 2026-09-11
Epoch AI 于 14 个月前推出的 FrontierMath Tier 4 基准——一组旨在测试 AI 推理极限的极难研究级数学题——如今每一道题都已被解决。
Afinetheorem 对比了预测数据:2025 年夏的 LEAP 专家小组曾预测较易的 Tier 1-3 在 2027 年 12 月前完成度为 55%;而在扩散模型方面 LEAP 过于乐观(目前实际约 1%,预测 12/27 为 7.3%)。他本人当时的判断是 80% 和 5%。
事实再次说明:研究级基准的「有效期」正被快速压缩,专家预测持续落后于模型进步速度。
所属事件:GPT-6 Astra 解完 FrontierMath Tier 4 全部研究级难题(2 条相关)→
「模型」频道最新
- 微软月度补丁修复 974 个漏洞,多数由 AI 系统发现 — Distinct-Question-16 · 2026-09-11
- DeepSeek V4.1 登顶 Vals 开源模型榜,每次测试仅 0.3 美元 — teortaxesTex · 2026-09-11
- 日常编码真需要旗舰模型吗?开发者和 80% 时间用中等档位 — iamaliveix · 2026-09-11
- OpenAI 平台疑似上线托管 Agents 功能:环境、模板、会话已可创建 — testingcatalog · 2026-09-11
- 30B 开源模型 OpenResearcher 在 BrowseComp-Plus 超 GPT-4.1 — TheZachMueller · 2026-09-11
- Surge 评测四大新模型:Fable 5.1 综合第一得 68.7 分 — echen · 2026-09-11