OpenAI 内部模型真实研究任务 80% 时间跨度仅约 15 分钟,远低于 METR 数据
ben_j_todd · x · 2026-09-29
Ben Todd 参与讨论 OpenAI 内部评测的一个关键发现:其最强内部模型在真实研究任务上的 80% 时间跨度(time-horizon)只有约 15 分钟,远低于 METR 基于通用软件工程任务、以及 UK AISI 基于网络攻击任务测出的水平。
他提出两点保留意见:一是这些结果仅落后 METR 约 8 倍,相当于约一年的进步量;二是图表显示模型在 64 小时以上的任务上仍常能成功,说明对创造性研究工作并非全无证据;曲线相当平滑,自然外推是全面持续进步。这条讨论触及「不同任务集下模型能力差距有多大」的核心争论。
「漫话AGI」频道最新
- 黄仁勋喊话 OpenAI 与 Anthropic:不安全就别发布 — nikola_mr64990 · 2026-09-29
- 数学难不在概念复杂,而在教育丢失了几何直觉 — TivadarDanka · 2026-09-29
- Fleuret:AI 时代人人如王室,可指挥比自己聪明的「人」 — francoisfleuret · 2026-09-29
- Reddit 热议:AI 减速呼吁是不是因为进展本身已经放缓? — Comfortable_Key_1346 · 2026-09-29
- Meta 推出 Muse for Small Business,可接入 Shopify 等 16 类工具 — gaganghotra_ · 2026-09-29
- 「超级通用智能早已存在:就是合作的人类」,Reddit 引发安全辩论 — EC36339 · 2026-09-29