ICML论文揭示数据重复严重拖累大模型训练

一项入选 ICML 的最新研究深入探讨了预训练数据重复对大语言模型的破坏性影响。研究发现,即使经过严格的去重处理,预训练数据中依然存在大量隐性的语义重复。这种内部数据重复不仅会严重破坏模型性能,还会导致约 33% 的算力被白白浪费。此外,规模越大的模型越容易受到这种语义重复现象的拖累。

2026-08-12 ~ 2026-08-12 · 2 条相关