o3 时间视界约 110 分钟,但写文献综述无一系统超 31% 分
le_james94 · x · 2026-09-16
该推文(其上一条推文讨论 DeepSeekMath-V2 将验证作为产品)指出 AI 能力测量正分裂为两条线:METR 的评测显示 o3 的 50% 时间视界约相当于 110 分钟人类工作量,大约每 7 个月翻倍;而在 DeepScholar-Bench 上,写一个相关工作章节,没有受测系统的几何平均分超过 31%。作者强调这两个数字都是真实的——能力在不同任务维度上的表现差异巨大。
所属事件:斯坦福CS329A开课:自我改进AI Agent九讲(5 条相关)→
「研究」频道最新
- 多智能体 RL 后训练破解 LLM 模式坍缩,提升回答多样性 — natashajaques · 2026-09-16
- 观点:世界模型到不了 AGI,持续学习才是最后也是最难的一块拼图 — Intelligent-Cream-14 · 2026-09-16
- 哲学家新书附录论证:为何可确信当下 LLM 并无意识 — AnnaCiaunica · 2026-09-16
- 普林斯顿造出光可编程「可擦写」超薄半导体,仅数分子厚 — MengdiWang10 · 2026-09-16
- ICML 2026 Oral:黎曼度量匹配让扩散几何估计快 400 倍 — allen_ai · 2026-09-16
- 655k 论文提取 600 万科学贡献,EMNLP 论文发布科学贡献图谱数据集 — mmbronstein · 2026-09-16