Ben Todd 再晒预测打脸数据:FrontierMath 与 LiveCodeBench 均远超预期
ben_j_todd · x · 2026-09-10
- 该帖是 Ben Todd 线程的引用链:主文本重申 FrontierMath 预测被大幅超越(预测 32%,实际 94%),被引段落补充 LiveCodeBench Pro 2025 年达 53%、远超其 23% 的预测。
- 核心观点不变:连圈内乐观派都系统性低估了过去一年 AI 进度。
所属事件:Ben Todd 复盘:AI 各项基准进度被全面低估(5 条相关)→
「漫话AGI」频道最新
- OpenAI 被指求解 Navier-Stokes?博主提醒:先搞懂它为何是大问题 — arpit_bhayani · 2026-09-10
- 2023 调查:1/3 ML 研究者认为 AI 致人类灭绝概率超 10% — ben_j_todd · 2026-09-10
- 放慢 AI 不现实,更可行的是加速安全研究投资 — tristanbob · 2026-09-10
- 开发者感慨:模型能做出人类想不到的 UX 设计权衡 — jakedahn · 2026-09-10
- 80,000 Hours 发布指南:如何用职业生涯降低 AI 风险 — ben_j_todd · 2026-09-10
- Blanche Minerva 用编译器类比讲清 Lean 形式化验证原理 — BlancheMinerva · 2026-09-10