斯坦福研究:数据重复致LLM预训练算力浪费达33%
斯坦福团队(含Joshua K.、Noam Levi及Sanmi Koyejo等)发表研究,指出数据重复对大模型预训练的危害取决于模型参数量、重复文档数量与重复次数之间的scaling相互作用。错误的组合不仅会损害模型性能,最坏情况下会导致高达33%的算力浪费。该研究为预训练阶段的数据去重与算力分配提供了量化参考。
2026-07-05 ~ 2026-07-05 · 2 条相关
- 数据重复致LLM预训练算力浪费可达33% — RylanSchaeffer · 2026-07-05
- 斯坦福研究:预训练数据重复最坏可浪费33%算力 — sanmikoyejo · 2026-07-05