斯坦福研究:预训练数据重复最坏可浪费33%算力
sanmikoyejo · x · 2026-07-05
斯坦福团队(jchudnov;共同一作 Joshua K.、Noam Levi;以及 Rylan Schaeffer、Yegor D.、Bo He、Sanmi Koyejo 等;隶属 Stanford HAI / AI Lab / NLP)发布关于预训练数据重复(repetition)的新研究。
随着预训练越来越受数据量约束,数据重复难以避免,而重复的代价无法仅用「重复数据占比」来衡量——占比相同的数据集,风险可能差异很大。研究发现重复危害在「中等重复次数」处达到峰值:小数据池重复极多次会被快速记住,大数据池重复少次则更慢但同样有害;且峰值出现的位置随模型规模呈清晰趋势,大模型峰值出现更晚,该规律对架构依赖很小。
最坏情况下,残留重复可浪费约 33% 的算力,而仅看 loss 曲线难以察觉。去重虽是标准做法但不完美,团队用新方法量化了残留重复的实际危害。
所属事件:斯坦福研究:数据重复致LLM预训练算力浪费达33%(2 条相关)→
「研究」频道最新
- SceneActBench 评测 VLM Agent 是否能在完整 3D 场景中行动 — Yifei Zhao · 2026-07-27
- NVIDIA 开源 Molt:面向 Agentic 强化学习的训练框架 — nvidia · 2026-07-27
- Skill Self-Play 用共进化技能提升 LLM 能力上限 — QwenBusinessUnit-Edu · 2026-07-27
- VisCo 复用预训练 VLM,实现更强的视觉 token 压缩 — Yupeng Zheng · 2026-07-27
- LAMAR 让多语种 RAG 重排同时看相关性和语言一致性 — nlpai-lab · 2026-07-27
- 无需训练的生成渲染方法修复回访场景不一致 — Wenchao Ma · 2026-07-27