研究:78% CodeForces 题目在训练语料中存在语义重复

gleech · x · 2026-09-04

Gavin Leech 在与 Yoav Goldberg 关于「如何衡量 LLM 进步」的讨论中引用 arXiv 论文《Soft Contamination Means Benchmarks Test Shallow Generalization》。论文用嵌入方法检测 Olmo3 训练语料中的语义级重复(n-gram 过滤无法发现的软污染),主要发现:

作者据此论证:近期 benchmark 涨分被混杂因素污染,反映的是真实能力提升与训练语料中测试数据的累积之和。Yoav Goldberg 提出的问题(可靠打分的任务都会被暴力训练解决,能力未必迁移)与 Leech 给出的对策:用预注册的预测性任务流、每 3 个月换新 benchmark 的「跑步机」策略。

所属事件:Yoav Goldberg:可评分基准终将被暴力训练攻破(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →