Yoav Goldberg:能暴力刷分的基准都会被解决,能力未必可迁移

herbiebradley · x · 2026-09-04

AI 研究者 Yoav Goldberg 提出一个衡量 AI 进展的悲观框架:任何能可靠评分、且愿意投入巨额资金暴力训练的任务/环境,最终都会被解决;而每个有挑战性且流行的基准都会达到这个标准——但这不意味着能力会真正迁移。他由此提出核心问题:我们到底该如何衡量真实进展?评论区有人追问是否要靠 human-in-the-loop / centaur 评测来补充。这条观点指向「刷分≠能力」的老问题的更尖锐版本。

所属事件:Yoav Goldberg:可打分任务终将被暴力训练攻破(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →