斯坦福研究:预训练数据重复最坏可浪费33%算力

sanmikoyejo · x · 2026-07-05

斯坦福团队(jchudnov;共同一作 Joshua K.、Noam Levi;以及 Rylan Schaeffer、Yegor D.、Bo He、Sanmi Koyejo 等;隶属 Stanford HAI / AI Lab / NLP)发布关于预训练数据重复(repetition)的新研究。

随着预训练越来越受数据量约束,数据重复难以避免,而重复的代价无法仅用「重复数据占比」来衡量——占比相同的数据集,风险可能差异很大。研究发现重复危害在「中等重复次数」处达到峰值:小数据池重复极多次会被快速记住,大数据池重复少次则更慢但同样有害;且峰值出现的位置随模型规模呈清晰趋势,大模型峰值出现更晚,该规律对架构依赖很小。

最坏情况下,残留重复可浪费约 33% 的算力,而仅看 loss 曲线难以察觉。去重虽是标准做法但不完美,团队用新方法量化了残留重复的实际危害。

所属事件:斯坦福研究:数据重复致LLM预训练算力浪费达33%(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →