ICML论文揭示数据重复严重拖累大模型训练
一项入选 ICML 的最新研究深入探讨了预训练数据重复对大语言模型的破坏性影响。研究发现,即使经过严格的去重处理,预训练数据中依然存在大量隐性的语义重复。这种内部数据重复不仅会严重破坏模型性能,还会导致约 33% 的算力被白白浪费。此外,规模越大的模型越容易受到这种语义重复现象的拖累。
2026-08-12 ~ 2026-08-12 · 2 条相关
- 数据重复浪费33%算力,ICML论文揭示预训练隐形成本 — RylanSchaeffer · 2026-08-12
- ICML 论文揭示:数据重复浪费 33% 算力,大模型更易受语义重复拖累 — RylanSchaeffer · 2026-08-12