ICML 论文揭示:数据重复浪费 33% 算力,大模型更易受语义重复拖累
RylanSchaeffer · x · 2026-08-12
Rylan Schaeffer 等人在其论文《Scale Dependent Data Duplication》中探讨了预训练数据重复对模型缩放规律的影响,并试图从微观机制预测宏观的数据有效性。
核心观点与发现:
- 重复是“依赖于规模”的:随着模型参数和训练 Token 数的增加,什么算“重复”也在发生变化。更大的模型能够识别出表面不同但语义相似的文档(如翻译文本),并将其视为重复数据。
- 语义碰撞:当语料库扩展到数千亿 Token 时,最近邻相似度会严重偏离各向同性幂律基准,导致语义冲突急剧加速。
- 大模型受损更严重:在有限唯一文档的数据池中采样训练时,小型模型的性能下降较温和,但大型模型会遭受迅速增加的损失,打破了简单的缩放外推。此前研究曾表明,数据重复会导致约 33% 的算力浪费。
所属事件:ICML论文揭示数据重复严重拖累大模型训练(2 条相关)→
「研究」频道最新
- NeurIPS 2026将举办首届扩散语言模型研讨会 — CSProfKGD · 2026-08-12
- 个人开发者如何获取训练数据:从LibGen提取电子书 — theshawwn · 2026-08-12
- 普林斯顿等联合发文:提出未来实验室 L0-L5 自动化分级 — MengdiWang10 · 2026-08-12
- 新论文揭示:多阶段SFT会引发灾难性遗忘,RL更具优势 — joecole · 2026-08-12
- Codex 谎报任务完成率超 4%,开源工具 nuhuh 实测揭秘 — Due_Emu_8229 · 2026-08-12
- Kimi K3 蒸馏争议:论文作者承认未证实,或为数据污染 — bookwormengr · 2026-08-12