800 模型实验:AI 文本污染网络语料反噬预训练
Pangram 团队发布一项 scaling law 研究,通过预训练约 800 个语言模型,量化网络爬取语料中日益增多的 AI 生成文本对预训练的影响。用 Pangram 检测器标注发现,经 FineWeb 质量过滤后的网络数据中,2026 年 6 月有 27.5% 的 token 被判定为 AI 生成,8 月已升至 31.1%。对数据充足的模型,混入 AI 文本反而推高损失。
已确认
- 研究预训练了 800 个语言模型,直接在真实网络语料上考察 AI 生成文本的影响,而非仅用人工合成混入。
- AI 生成文本占比持续上升:FineWeb 过滤后 6 月 27.5%,8 月 31.1%(m3 提及未过滤口径约 31%,与 8 月数据一致)。
- 在未过滤的爬取数据上训练,所需算力是只在人类文本上训练的约 3 倍。
- 效果与数据充裕程度相关:对每参数人类 token 不足约 10 个的数据稀缺模型,加入 AI 生成 token 可降低在人类文本上的 loss;但从 Chinchilla 最优比例(约 20)起,继续加入 AI token 反而推高损失。
- 结论:对已数据充足的模型,混入 AI 生成文本的训练效果甚至不如不添加新数据(@MohitIyyer 转述 @jennajrussell 线程的总结)。
为什么重要
- 该研究首次以大规模真实语料与成百上千个模型系统量化「AI 文本反噬」:随着 AI 生成内容持续涌入互联网,不加区分地爬取训练不仅无益,还会显著推高算力成本、损害模型质量。
- 对数据稀缺的小模型,合成数据仍有增益,说明影响是条件性的,为数据配比策略提供了明确参考点(约 10 token/参数 与 Chinchilla 约 20 的分界)。
2026-10-01 ~ 2026-10-02 · 5 条相关
一手来源
- 预训练 800 个模型揭示:AI 生成文本过量反而损害语言模型训练 — pangram ·
- 预训练 800 个模型揭示:AI 生成文本混入语料会反噬训练效果 — iScienceLuvr ·
- 800 个模型实验:混入 AI 文本预训练反而不如不加新数据 — MohitIyyer ·
- 【源头】预训练 800 个模型揭示:AI 生成文本混入语料会反噬训练效果 — iScienceLuvr · 2026-10-01
- 新研究发现:模型数据充足后,混入AI生成文本反而推高损失 — gleech · 2026-10-02
- 论文测算:AI 文本污染爬虫语料,预训练算力成本将涨至 3 倍 — cephaloform · 2026-10-02
另有 2 条近重复转述:pangram · MohitIyyer