Yoav Goldberg:可评分基准终将被暴力训练攻破

知名 NLP 研究者 Yoav Goldberg 提出关于衡量 AI 进展的冷峻判断:任何能被可靠打分的任务,只要投入足够多资金进行暴力式训练,最终都会被解决;而每个有挑战性且流行的基准都会被攻破,但刷分所得能力未必能迁移。Gavin Leech 在相关讨论中引用 arXiv 论文指出,78% 的 CodeForces 题目在训练语料中存在语义重复,进一步质疑现有基准的衡量效力。

2026-09-04 ~ 2026-09-04 · 3 条相关

另有 1 条近重复转述:herbiebradley