800 个模型实验:混入 AI 文本预训练反而不如不加新数据
MohitIyyer · x · 2026-10-02
Mohit Iyyer 转发并总结了一项关于「AI 生成文本对预训练影响」的 scaling law 研究(引用 @jennajrussell 的线程):
- 用 Pangram 标注,2026 年 8 月 FineWeb 过滤后的网络文本中 31% 的 token 为 AI 生成,较 2024 年 6 月的 10% 大幅上升,且增速很快
- 团队预训练了 800 个语言模型(参数量 19.9M–973M),在「人类+AI 文本」不同混合比例下训练
- 结论:在大多数标准训练预算下,往训练集中添加 AI 生成文本,效果比完全不添加新数据还差——即模型会「中毒」,就像人脑读 AI slop 一样
这项工作为数据污染问题提供了系统性的定量证据,随 AI 文本占比持续攀升,问题正变得更加紧迫。
所属事件:800 模型实验:AI 文本污染网络语料反噬预训练(5 条相关)→
「研究」频道最新
- ARC Prize 发现:Qwen3.8-27B 的 low/xhigh 档在 chat template 里写死不同指令 — GregKamradt · 2026-10-02
- 安全研究者重提 DataScalar:90 年代被埋没的近数据计算架构 — lauriewired · 2026-10-02
- AAAI 主席发帖:审稿改革意在劝退「微小结果」论文 — tdietterich · 2026-10-02
- 评测者自述防刷榜心法:全量轮换题目+随时换方法论 — airesearch12 · 2026-10-02
- GOLLuM 回顾基准成绩:找 Top-5% 结果命中率 36.3% 胜描述符 29.7% — pschwllr · 2026-10-02
- 用语言模型学反应表征,多目标化学反应优化超越描述符方法 — pschwllr · 2026-10-02