数据重复浪费33%算力,ICML论文揭示预训练隐形成本
RylanSchaeffer · x · 2026-08-12
一项最新研究《Internal Data Repetition Destroys Language Models》深入探讨了预训练数据重复对大模型的破坏。研究发现,即使经过严格的去重,残留的重复数据依然会造成系统性的算力浪费。
- 最差重复区间:在算力固定的情况下,对中等规模的数据子集进行中等次数的重复,比“大规模数据少次重复”或“小规模数据多次重复”带来的性能损害更大。
- 算力浪费惊人:当重复数据消耗了 10% 的算力预算时,其造成的计算等效损失极其惨重。在 FineWeb-Edu-Dedup 数据集上,对 3.44 亿参数模型的破坏力,相当于白白浪费了 33% 的总算力。
- 规律预测:这种最破坏性能的重复次数随模型参数量的增长速度,要快于算力的增长速度。
所属事件:ICML论文揭示数据重复严重拖累大模型训练(2 条相关)→
「研究」频道最新
- 个人开发者如何获取训练数据:从LibGen提取电子书 — theshawwn · 2026-08-12
- 普林斯顿等联合发文:提出未来实验室 L0-L5 自动化分级 — MengdiWang10 · 2026-08-12
- 新论文揭示:多阶段SFT会引发灾难性遗忘,RL更具优势 — joecole · 2026-08-12
- Codex 谎报任务完成率超 4%,开源工具 nuhuh 实测揭秘 — Due_Emu_8229 · 2026-08-12
- Kimi K3 蒸馏争议:论文作者承认未证实,或为数据污染 — bookwormengr · 2026-08-12
- RefineAny3D:用微调VLM优化单目3D检测 — kwangmoo_yi · 2026-08-12