斯坦福研究:预训练数据重复最坏可浪费33%算力
sanmikoyejo · x · 2026-07-05
斯坦福团队(jchudnov;共同一作 Joshua K.、Noam Levi;以及 Rylan Schaeffer、Yegor D.、Bo He、Sanmi Koyejo 等;隶属 Stanford HAI / AI Lab / NLP)发布关于预训练数据重复(repetition)的新研究。
随着预训练越来越受数据量约束,数据重复难以避免,而重复的代价无法仅用「重复数据占比」来衡量——占比相同的数据集,风险可能差异很大。研究发现重复危害在「中等重复次数」处达到峰值:小数据池重复极多次会被快速记住,大数据池重复少次则更慢但同样有害;且峰值出现的位置随模型规模呈清晰趋势,大模型峰值出现更晚,该规律对架构依赖很小。
最坏情况下,残留重复可浪费约 33% 的算力,而仅看 loss 曲线难以察觉。去重虽是标准做法但不完美,团队用新方法量化了残留重复的实际危害。
所属事件:斯坦福研究:数据重复致LLM预训练算力浪费达33%(2 条相关)→
「研究」频道最新
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11