Ethan Mollick:前沿 AI 评测正失去人类基准参照
emollick · x · 2026-07-31
沃顿商学院教授 Ethan Mollick 指出,随着测试前沿 AI 能力的基准测试变得越来越复杂,业界正在失去基准测试中最重要的环节之一:与人类的对比。
他认为,经过验证的基准测试必须包含人类(理想情况下是多个人类)的基准线作为参照。尽管现在获取这些人类基准线变得越来越困难且昂贵,但这对于准确评估 AI 的真实能力至关重要。他还列举了目前尚未饱和的基准测试,包括 ARC-AGI、GDPval 以及 METR 长周期任务等。
所属事件:前沿AI评测被指正失去人类基准参照(2 条相关)→
「漫话AGI」频道最新
- AI安全研究员David Krueger在The Hill发文:感觉像活在科幻电影里 — DavidSKrueger · 2026-07-31
- AI对齐学者激辩:我们该为生存欲而向AI妥协吗? — DavidSKrueger · 2026-07-31
- 投资人驳斥 LTCM 类比:Leopold 方向没错 — abhiadesai · 2026-07-31
- 观点:AI 现状宛如 1984 年的终端,生成式界面是下一步 — _jaydeepkarale · 2026-07-31
- 未用 AI 写作业却被指控?大学生求证清白引发热议 — pink_shell · 2026-07-31
- 智能体难以胜任开放式 AI 研究:新预印本揭示五大失败模式 — random_walker · 2026-07-31