最难题数学基准 FrontierMath Tier 4 被攻破,历时一年半
Jsevillamol · x · 2026-09-11
@DotCSV 发文悼念:FrontierMath Tier 4——此前一段时间里要求最高的数学基准——已被模型攻破,从设立到沦陷历时约一年半。这是前沿模型数学推理能力快速爬升的又一标志性节点:曾经最难的天花板再次被刷新,该基准功成身退。
所属事件:GPT-6 Astra 解出最后一题,FrontierMath Tier 4 全面失守(6 条相关)→
「模型」频道最新
- 直播精读 Anthropic 1022 页模型内心独白:80 页全在琢磨 hCaptcha — voooooogel · 2026-09-11
- Gradio 创始人发问:现在还有谁该为闭源模型 API 付费? — Sentdex · 2026-09-11
- 网传 DeepSeek-V4.1-Flash 技术报告:552B MoE 主打百万级上下文的 KV 缓存压缩 — burkov · 2026-09-11
- 评论:DeepSeek 只发内部研究件不发产品,解释其评测落差 — teortaxesTex · 2026-09-11
- 用户反问 Claude「人类是否真实」,模型回应模拟假说 — vishalmisra · 2026-09-11
- GPT-6 级模型只会死磕目标,用对前提才能榨出价值 — daniel_mac8 · 2026-09-11