Yoav Goldberg:能用分数衡量的任务都会被暴力训练攻破
yoavgo · x · 2026-09-04
知名 NLP 研究者 Yoav Goldberg 提出一个关于衡量 AI 进展的冷峻判断:任何能被可靠打分的任务/环境,只要投入足够多的钱(他形容为「惊人的数量」)进行暴力式训练,最终都会被解决;而每一个有挑战性且流行的 benchmark 都会达到这个门槛,因此都会被攻克。但关键问题是:被攻克的这些能力并不一定会迁移到其他任务上。这意味着「benchmark 成绩」与「真实能力提升」正在脱钩,他最后抛出核心疑问:我们到底该如何衡量模型的真实进展?
「漫话AGI」频道最新
- Forethought 探讨星系殖民中的「守夜人」超智能:收益与风险 — willmacaskill · 2026-09-04
- AI BioDesign 研究加速器成立,联手 UW Medicine 用 AI 设计生物工具 — AllThingsApx · 2026-09-04
- 从 Uber 反抗到拥抱 Uber:在位者为何总在阻挡新技术 — carlbfrey · 2026-09-04
- 被一条评论拆掉论文后,他用工程学「安全系数」重写 AI 意识立场 — Passelume · 2026-09-04
- Move 37 反驳 Zelnick:数据集不是创造力的天花板 — r0ck3t23 · 2026-09-04
- 「软件开发领域我们已有 AGI」:一句话观点再引 Astra 定位之争 — haider1 · 2026-09-04