Gaperon 论文警示:数据污染可虚增跑分,开放式评测遭围观点名
burny_tech · x · 2026-09-09
转发链围绕一篇讨论语言模型评测可信度的 arXiv 论文 Gaperon(2510.25771)展开:
- Gaperon 团队开源了 1.5B/8B/24B 的法英双语言模型套件(2-4 万亿 token 训练),附全部数据、代码与数百个中间 checkpoint。
- 关键发现:语言质量过滤提升文本流畅度但拉低 benchmark 分数;而故意在训练后期混入测试集「污染」能在几乎不损害生成质量的前提下追回有竞争力的分数。
- 论文还指出常见神经过滤可能无意中放大 benchmark 泄漏,并在预训练中加入无害数据投毒作为安全研究测试床。
转发者 soldni 借此提醒:用新语料训练的模型跑分更好,可能存在两个混杂因素——测试数据污染,以及 OLMES 等评测集恰是数据配方开发时常用的 benchmark,新配方可疑地对其过拟合。这条链是针对某账号分析(@dwarkeshsp)的方法论质疑,提醒 benchmark 分数上涨不一定代表真实能力提升。
「模型」频道最新
- Altman 回应数学证明之争:曾提议对方先发并拿走奖项 — zacharynado · 2026-09-09
- NSA/FBI/CISA 建议对疑似蒸馏模型静默降级,误伤引担忧 — xuanalogue · 2026-09-09
- OpenAI 求解 Navier-Stokes 背后:边训边部署、万级智能体分工协作 — DataLearnerAI · 2026-09-09
- 曝 GPT-6 Astra p80 任务时长约 11.6 小时,逼近 AI-2027 预测曲线 — haider1 · 2026-09-09
- Astra 在仪表盘上出怪错:仅用 44% 上下文就翻车 — eigenron · 2026-09-09
- ChatGPT 新口头禅引吐槽:每条回复都要补一句「我不会做的事」 — slsflannery · 2026-09-09