OpenAI 内部模型真实研究任务 80% 时间跨度仅约 15 分钟,远低于 METR 数据

ben_j_todd · x · 2026-09-29

Ben Todd 参与讨论 OpenAI 内部评测的一个关键发现:其最强内部模型在真实研究任务上的 80% 时间跨度(time-horizon)只有约 15 分钟,远低于 METR 基于通用软件工程任务、以及 UK AISI 基于网络攻击任务测出的水平。

他提出两点保留意见:一是这些结果仅落后 METR 约 8 倍,相当于约一年的进步量;二是图表显示模型在 64 小时以上的任务上仍常能成功,说明对创造性研究工作并非全无证据;曲线相当平滑,自然外推是全面持续进步。这条讨论触及「不同任务集下模型能力差距有多大」的核心争论。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →