Ethan Mollick:前沿 AI 评测正失去人类基准参照

emollick · x · 2026-07-31

沃顿商学院教授 Ethan Mollick 指出,随着测试前沿 AI 能力的基准测试变得越来越复杂,业界正在失去基准测试中最重要的环节之一:与人类的对比。

他认为,经过验证的基准测试必须包含人类(理想情况下是多个人类)的基准线作为参照。尽管现在获取这些人类基准线变得越来越困难且昂贵,但这对于准确评估 AI 的真实能力至关重要。他还列举了目前尚未饱和的基准测试,包括 ARC-AGI、GDPval 以及 METR 长周期任务等。

所属事件:前沿AI评测被指正失去人类基准参照(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →