14 个月从 5% 到 98%,Epoch AI 数学基准宣告饱和
Jsevillamol · x · 2026-09-11
- Epoch AI 研究员引用官方数据:其 Tier 4 数学基准于 2025 年 7 月 11 日上线时,最高分仅 5%;不到 14 个月后,最高分已达 98%,官方认为该基准已被「刷爆」。
- 转发者 @kikollan 感叹 AI 数学能力的进步几乎是突然发生的:三年前基于 LLM 的模型连加法都做不好,如今已能攻克高难度数学题。
- 这一速度也再次印证了基准饱和速度远超预期、需要更快迭代更难评测的行业现状。
所属事件:Epoch AI 数学基准 14 个月从 5% 飙至 98% 宣告饱和(3 条相关)→
「模型」频道最新
- 曝 DeepSeek 4.1 flash 也用超大 ngram 词嵌入,架构酷似 Qwen4 — ccerrato147 · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评 — Scobleizer · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11