字节清华重做数据重复实验:固定 TPP 下最优重复次数随模型变大而增加

Scaling Domain Data Repetition in LLM Pretraining

Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang

cs.AI

2026-08-14

字节 Seed 与清华在固定 tokens-per-parameter 比率的实际缩放设定下重做领域数据重复实验:最优重复次数与该领域验证 loss 强负相关(Pearson -0.944),且随模型变大温和上升,小模型上调好的重复数可以保守地迁移到大模型。

这篇在解决什么

预训练里高质量领域数据(代码、数学、Wiki、医学)比通用网页数据难扩得多。模型越大、token 预算越大,这类数据在混合配方里的占比就被稀释得越厉害。重复是现成的对策,但过去十年的共识是「大模型更容易被重复数据过拟合,所以模型越大越要少重复」。这条共识有一个隐含前提:对比不同规模时,训练数据总量 D 是固定的。

实际问题不这么走。按 Chinchilla 一脉的缩放律,token 预算 D 应该跟模型规模 N 成比例增长,也就是保持 TPP = D/N 不变。论文指出,换到这个设定下,结论整个翻过来:固定 TPP 时,最优重复次数随模型变大而增加。

方法

实验设定对齐实际缩放:每个规模 N 的 token 预算 DN = TPP·N(TPP 取大于 100 的常数),同一规模的所有训练跑完全相同的 token 数。对 Code、Math、Wiki、Medical 四个领域,分别扫两个旋钮:独特数据占比 α∈{1/40, 1/20, 1/10},重复次数 e∈{1..7}。选定 (d, N, α, e) 后,从领域 d 里取 α·DN 的独特 token 重复 e 遍,剩余预算用不重复的网页数据填满。每次只重复一个领域。优化器用 Muon,按幂律随规模调学习率和 batch size。

对每组配置,把最终验证 loss 对重复次数拟合二次曲线,取拟合曲线的最低点作为「估计最优重复次数」,避开离散网格的粗糙。配套一个理论模型:one-hot 线性回归里,把风险分解为知识获取误差与噪声拟合误差,重复优化前者、加剧后者,给出两条定理解释为什么低 loss 领域能承受更多重复、以及固定 D 与固定 TPP 两种设定下模型规模的影响方向相反。

结果

三个相关性数字把结论钉死:

因素与最优重复次数的 Pearson 相关
领域最小验证 loss-0.944
模型规模+0.400
独特数据占比 α+0.018

领域差异很大:Math 最耐重复,最优次数 56;Code 45;Wiki 和 Medical 都在 34。分领域看「等量独特数据 vs 重复数据」的替代关系,Math 从重复 1 次加到 4 次,验证 loss 只小幅上升,基本能当独特数据用;Wiki 重复超过 2 次就明显劣化,重复 token 换不来等量独特数据。Code 和 Medical 的表现更接近 Wiki。

OOD 一侧是好消息:固定领域总占比时,把独特 token 换成重复 token,在 ArXiv 和 News 两个域外验证集上 loss 基本不动。重复的伤害是域内的,不外溢。

学习率调度的影响值得单独记:WSD 调度里 decay 起点越早,能承受的重复次数越少;恒定学习率最能容忍重复。低学习率阶段看到的重复样本会被拟合得更紧,记忆样本特有模式的倾向更强。

为什么重要

对配数据配方的人,这是一条可直接落地的流程:在与目标模型同 TPP 的小代理模型上,用任意一个代表性 α 扫重复次数,得到的结果可以保守地用于大模型。所谓保守,是实验证明小模型上不过拟合的重复数,在同 TPP 的大模型上也不会过拟合。这省掉了在大模型上烧钱扫参。α 几乎不影响最优重复次数这一点也很实用,代理实验不必复刻目标配方的独特数据占比。

「等量独特数据值多少重复数据」没有统一答案,按领域分别估。数学语料重复 4 遍的损失很小,百科语料超过 2 遍就开始亏。

局限与存疑

模型规模和具体训练配置在正文里没有披露,只有按幂律调参和 Muon 这些片段,复现门槛不低。每次实验只重复一个领域,而真实预训练是多个领域同时重复、相互作用的,作者自己也把这条列为未来工作。理论部分是 one-hot 线性回归模型,对真实 Transformer 的指导意义是定性的。固定域内占比的 OOD 结论依赖「网页数据量不变」这个控制,如果重复挤占了网页预算,结论未必成立。重复次数网格只到 7,数学领域最优 56 已经贴近网格边缘,真实最优可能更高。

术语

原文与代码

社区讨论

相关论文

全部论文解读