研究:78% CodeForces 题目在训练语料中存在语义重复
gleech · x · 2026-09-04
Gavin Leech 在与 Yoav Goldberg 关于「如何衡量 LLM 进步」的讨论中引用 arXiv 论文《Soft Contamination Means Benchmarks Test Shallow Generalization》。论文用嵌入方法检测 Olmo3 训练语料中的语义级重复(n-gram 过滤无法发现的软污染),主要发现:
- 污染普遍存在:78% 的 CodeForces 题目找到语义重复,50% 的 ZebraLogic 题目存在完全重复
- 在训练数据中加入 benchmark 数据的语义重复确实能提升 benchmark 成绩
- 在重复样本上微调,对同 benchmark 真正留出集的成绩也会提升
作者据此论证:近期 benchmark 涨分被混杂因素污染,反映的是真实能力提升与训练语料中测试数据的累积之和。Yoav Goldberg 提出的问题(可靠打分的任务都会被暴力训练解决,能力未必迁移)与 Leech 给出的对策:用预注册的预测性任务流、每 3 个月换新 benchmark 的「跑步机」策略。
所属事件:Yoav Goldberg:可评分基准终将被暴力训练攻破(3 条相关)→
「研究」频道最新
- 研究者吐槽评测靠推特风向,预告基于 EvalEval 的动态综合指数 — evijit · 2026-09-04
- 从 agent trace 到训练数据集:采样、标注的完整工作流拆解 — spilldahill · 2026-09-04
- 研究者可视化 Qwen 2.5 嵌入空间,称主流模型对话能力正在变平 — arianaram · 2026-09-04
- DeepMind 科学家谈 MatFormer:让智能体按任务难度调算力 — jainprateek_ · 2026-09-04
- 李飞飞团队谈 Atlas 世界模型:新视角预测是核心原语 — a16z Podcast · 2026-09-04
- 具身数据集 ACE-Data-0 上线一周冲上 HF 热榜,下载近 3 万 — liuziwei7 · 2026-09-04