牛津学者批 METR 人类扩展曲线:超 8 小时数据只是并行堆人假象
tobyordoxford · x · 2026-10-09
牛津大学学者 Toby Ord 继续质疑 METR 的「人类 vs AI 扩展曲线」研究。他指出一个关键方法学缺陷:没有任何人类试验时长超过 8 小时,曲线在那之后的「人类」表现实际上是 best-of-k 次尝试(即从多个并行试验里挑最好结果)。因此图表显示人类在 8 小时后扩展效果变差,其实是把「扩展串行时间」切换成「扩展并行工作者」造成的伪影,并非人类真实的串行时间扩展能力。
「研究」频道最新
- 审稿人吐槽:AI 写的论文工整却难读,指代关系全靠猜 — Bollegala · 2026-10-09
- 审稿流程延误,WACV 2027 第二轮结果推迟至 10 月 14 日 — CSProfKGD · 2026-10-09
- OpenAI 数学定理证明 RL 环境数据集上线 Hugging Face — himanshustwts · 2026-10-09
- OpenAI 数学成果开源为 RL 环境,可作强化学习训练素材 — SergioPaniego · 2026-10-09
- 数学家抱怨 OpenAI 数学论文写得太烂:不看 AI 根本读不懂 — burny_tech · 2026-10-09
- Station 环境让 AI 自主再发现 ICLR 论文 62.7% 结论,远超 Codex 与 AI Scientist — progenitor414 · 2026-10-09