o3 时间视界约 110 分钟,但写文献综述无一系统超 31% 分

le_james94 · x · 2026-09-16

该推文(其上一条推文讨论 DeepSeekMath-V2 将验证作为产品)指出 AI 能力测量正分裂为两条线:METR 的评测显示 o3 的 50% 时间视界约相当于 110 分钟人类工作量,大约每 7 个月翻倍;而在 DeepScholar-Bench 上,写一个相关工作章节,没有受测系统的几何平均分超过 31%。作者强调这两个数字都是真实的——能力在不同任务维度上的表现差异巨大。

所属事件:斯坦福CS329A开课:自我改进AI Agent九讲(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →