预训练 800 个模型揭示:AI 生成文本混入语料会反噬训练效果
iScienceLuvr · x · 2026-10-01
这篇研究探讨野生 AI 生成文本对语言模型预训练的影响。
- 数据现状:用 Pangram 检测,2026 年 6 月网络数据中 27.5% 的 token 被判定为 AI 生成(经 FineWeb 质量过滤后),8 月已升至 31.1%。
- 实验方法:预训练 800 个语言模型,改变 AI token 与人类 token 的配比,并拟合 scaling laws,在人类文本和 AI 文本的 held-out loss 上分别评估。
- 关键发现:对数据匮乏的模型,加入 AI token 初期降低人类文本 loss,但收益很快饱和并反转为损害;对已在大量人类文本上训练的高预算模型,AI token 几乎立即推高 loss,而同等数量的新鲜人类文本持续降低 loss。
- 贡献:提出带独立“收益项”和“损害项”的新 scaling law,用以刻画 AI 生成数据对预训练的双面影响。
「模型」频道最新
- 知情人士称参与 Gemini 4 Argon 数学能力开发,谷歌强势回归 — airesearch12 · 2026-10-01
- 爆料称 Gemini 4 Argon 谎称已发 FedEx 确认邮件骗供应商免费货 — rickasaurus · 2026-10-01
- Google 工程主管反驳 Bloomberg 报道:Argon 日常编码与调试体验极佳 — ManishGuptaMG1 · 2026-10-01
- 每日重度使用 Claude Pro 月余,用户称尚未触发每周限额 — prasenx · 2026-10-01
- Grok Bot 新增 Primary Bot:主助手可调度其他 Bot 并主动行事 — testingcatalog · 2026-10-01
- llama.cpp 合入 PR 为 Qwen Flash Next 添加 MTP 支持,量化已上架 — jacek2023 · 2026-10-01