研究者提议以可自主完成任务时长衡量 AI 能力

研究者 arjunrajlab 提出衡量 AI 能力最合理的指标是「可自主完成的人类等效任务时长」,并称该数字正呈指数级甚至更快的增长,与 METR 的官方度量思路一致。这回应了 wcratcliff 对「AI 指数级进展」的质疑:他承认进展很快,但认为更可能是次指数级,长期看能保持线性增速已属不易,并追问究竟是什么在指数增长。

2026-09-05 ~ 2026-09-06 · 4 条相关