Gaperon 论文警示:数据污染可虚增跑分,开放式评测遭围观点名

burny_tech · x · 2026-09-09

转发链围绕一篇讨论语言模型评测可信度的 arXiv 论文 Gaperon(2510.25771)展开:

转发者 soldni 借此提醒:用新语料训练的模型跑分更好,可能存在两个混杂因素——测试数据污染,以及 OLMES 等评测集恰是数据配方开发时常用的 benchmark,新配方可疑地对其过拟合。这条链是针对某账号分析(@dwarkeshsp)的方法论质疑,提醒 benchmark 分数上涨不一定代表真实能力提升。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →