预训练数据重复浪费算力?ICML论文揭示大模型更耐重复
heghbalz · x · 2026-08-22
这篇论文探讨了在大模型预训练中,当高质量领域数据稀缺时,通过重复数据来维持固定 TPP(tokens-per-parameter)的策略。研究发现:
- 模型越大越耐重复:在固定 TPP 下,最优重复次数会随模型尺寸增加而轻微增加,更大的模型配合更短的学习率衰减能更好地容忍重复。
- 质量决定重复上限:不同领域的最优重复次数与其最终验证损失呈强负相关,即质量越高(Loss越低)的数据,重复次数可以越多。
- 代理模型调参有效:在保持 TPP 一致的情况下,可以在小规模代理模型上调试出的最优重复次数,用来指导大规模模型的训练配置。
这为解决高质量数据稀释问题提供了新的工程视角。
所属事件:ICML新研究:模型越大越耐预训练数据重复(2 条相关)→
「Infra」频道最新
- SGLang 推出权重缓存守护进程,万卡模型重启加速 16 倍 — xiaosun86 · 2026-08-22
- Agent 循环致上下文膨胀,5% 故障耗掉 25% 成本 — MaverikSh · 2026-08-22
- llama.cpp 发布 v0.2.0,转向语义化版本管理 — PhilippeEiffel · 2026-08-22
- 开源工具 Mark Cleaner:本地移除 AI 文本隐形水印与元数据 — VraserX · 2026-08-22
- Marin开源23万亿token预训练数据,可公开下载 — joecole · 2026-08-22
- James Long 领悟 Sandbox 用例:关键在于无限算力而非安全 — Vjeux · 2026-08-22