METR 任务时长提前 20 个月达标,LiveCodeBench Pro 已至 53%
ben_j_todd · x · 2026-09-10
- Ben Todd 线程再补两条被超越的预测:METR 80% 任务时长基准,多数人预计 2026 年底才到 3 小时,实际 4 月就已达成;Todd 自己预测年底 6 小时,目前看在轨。
- LiveCodeBench Pro 方面,他预测 2026 年底 23% 已远超共识,但 AI 实际 2025 年就冲到 53%。
所属事件:Ben Todd 复盘:AI 各项基准进度被全面低估(5 条相关)→
「漫话AGI」频道最新
- OpenAI 被指求解 Navier-Stokes?博主提醒:先搞懂它为何是大问题 — arpit_bhayani · 2026-09-10
- 2023 调查:1/3 ML 研究者认为 AI 致人类灭绝概率超 10% — ben_j_todd · 2026-09-10
- 放慢 AI 不现实,更可行的是加速安全研究投资 — tristanbob · 2026-09-10
- 开发者感慨:模型能做出人类想不到的 UX 设计权衡 — jakedahn · 2026-09-10
- 80,000 Hours 发布指南:如何用职业生涯降低 AI 风险 — ben_j_todd · 2026-09-10
- Blanche Minerva 用编译器类比讲清 Lean 形式化验证原理 — BlancheMinerva · 2026-09-10