BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-scale Pretraining
DatologyAI, :, Pratyush Maini, Vineeth Dorna, Parth Doshi, Aldo Carranza, Fan Pan, Jack Urbanek, Paul Burstein, Alex Fang, Alvin Deng, Amro Abbas, Brett Larsen, Cody Blakeney, Charvi Bannur, Christina Baek, Darren Teh, David Schwab, Haakon Mongstad, Haoli Yin, Josh Wills, Kaleigh Mentzer, Luke Merrick, Ricardo Monti, Rishabh Adiga, Siddharth Joshi, Spandan Das, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt
cs.LG, cs.CL
2025-08-15
小模型多策略改写网页文本,14 项基准超 Cosmopedia 5.1 个百分点,比纯网页数据快 7.7 倍达标。
预训练撞上了数据墙:高质量、高信息密度的人类文本是有限的,而训练预算已经涨到万亿 token 量级,重复喂旧数据只会过拟合。合成数据是公认的出路,Phi、Cosmopedia、Nemotron-CC 都验证过有效,2025 年的前沿模型几乎都在用。缺的是一份受控实验答案:它到底为什么有效,哪些变量在起作用。
合成数据有两条路线。generator-driven 让大模型凭参数记忆从零写教科书,成本高,覆盖面受生成器限制;source rephrasing 让小模型把已有网页改写成问答、教学文本等格式,WRAP 和 Nemotron-CC 走的是这条路,如今已是工业界主流。DatologyAI 把两条路线放进同一套实验,逐个拆了七个变量,再把结论组装成自己的数据生产框架 BeyondWeb。
BeyondWeb 的原料是用自家方法从 DCLM 筛出的高质量子集,改写策略分三类:
训练配比 60% 随机 RedPajama + 40% 合成数据。基础设施从 Slurm + AWS Hyperpod 迁到 Kubernetes 上的 Ray + vLLM,支撑万亿 token 量级的并行改写。
框架的每个设计选择背后都有一组消融:种子质量优先于新知识、风格对齐部署分布、生成策略必须多样。单看每条原则收益都不大,组合起来才是 5 个百分点级别的差距。
主实验在 Llama-3 架构的 1B / 3B / 8B 三个规模上做,14 项基准取 0-shot 和 5-shot 平均:
| 设置 | 基线 | BeyondWeb | 差距 |
| 1B,1T token | RedPajama 50.7% | 57.4% | +6.7pp |
| 3B,180B token | RedPajama 53.5% | 60.8% | +7.3pp |
| 8B,180B token | RedPajama 56.6% | 63.7% | +7.1pp |
| 8B,180B token | Nemotron-Synth 61.1% | 63.7% | +2.6pp |
| 8B,180B token | Cosmopedia 58.6% | 63.7% | +5.1pp |
8B 模型用 23.2B token 就达到 RedPajama 喂 180B 的精度,提速 7.7 倍;66.2B token 达到 Nemotron-Synth 的 180B 精度,提速 2.7 倍。3B 模型在 BeyondWeb 上拿 60.8%,高过 8B Cosmopedia 的 58.6%。
消融的数字更有信息量,全部在 1B 模型、20B token 设置下。一句「总结以下文本」的朴素 prompt 拿 46.7%,几乎追平 Cosmopedia 精心设计的教学内容生成(47.1%),说明 generator-driven 的大半收益只是信息压缩;BeyondWeb 是 50.4%。数据墙实验里,数据重复两遍 45.5%,让 LLM 顺原文续写 46.2%,恰好等于全量数据上界 46.2%,BeyondWeb 超出上界 4.2pp。数据墙可以破,朴素续写破不了。改写器家族几乎不影响质量:OLMo-2-7B、Llama-3.1-8B、Phi-4-14B、Mistral-7B 的产出都在 1 个百分点内,基准分最低的 OLMo(59.6%)反而产出最好的合成数据(49.9%)。改写器规模过了 3B 就饱和:1B 到 3B 涨 1.5pp,3B 到 8B 只涨 0.4pp。网页里对话式内容只占 3.67%,上采样到 50% 也只涨 0.9pp,超过 20% 后收益趋平。
这是少数带生产背书的合成数据消融研究:BeyondWeb 已用于 ArceeAI AFM4.5B 的 7T token 预训练数据集,不只在小设置里成立。给从业者的可操作结论有三条:不必用最贵的生成器,3B 级开源模型改写就够;prompt 策略的多样性比单点优化值钱,长训练里尤其如此;高质量数据重复当种子,好过引入低质量新数据。按 token 计价的训练预算下,7.7 倍达标提速就是直接省下的成本。
论文自己承认的点:Cosmopedia 只有 27B token,长实验靠重复补足,作者辩称这是 generator-driven 范式的固有缺陷,但对这个基线确实不利;续写实验的生成器见过的数据远超 20B token,可能带入参数知识;改写器规模的结论被标注为仅适用于当前设置。
读下来的疑问:消融大多在 1B + 20B token 做,外推到 8B + 180B 的证据链不完整;BeyondWeb 的具体 prompt 和完整配方没有公开,基础设施细节推给后续发布,复现门槛高;DatologyAI 本身是卖数据平台的公司,这篇同时是产品证明文。基准污染全文未讨论。