预训练 800 个模型揭示:AI 生成文本过量反而损害语言模型训练
pangram · hf · 2026-10-01
Pangram 团队研究网络预训练数据中日益增多的 AI 生成文本的影响。经 FineWeb 过滤后,2026 年 6 月网络数据中 27.5% 的 token 被判定为 AI 生成,8 月升至 31.1%。
- 预训练 800 个语言模型,改变 AI token 与人类 token 的配比,并拟合 scaling law
- 数据稀缺时,加入 AI token 初期降低人类文本 loss,但很快饱和并反转为伤害
- 高人类数据预算下,AI token 几乎立刻抬升 loss,而等量新鲜人类 token 持续降低
- Hoffmann 等人的 scaling law 无法预测此行为;新提出的含收益/损害两项的 scaling law 在 3.6 倍大模型上预测误差降低 41%
- 建议:目标是人类文本时应过滤 AI 文本、优先重复人类数据;发布 83B token 的 WildAI 语料库(含 AI/主题/格式标签)、800 个模型与代码
所属事件:800 模型实验:AI 文本污染网络语料反噬预训练(5 条相关)→
「研究」频道最新
- ARC Prize 发现:Qwen3.8-27B 的 low/xhigh 档在 chat template 里写死不同指令 — GregKamradt · 2026-10-02
- 安全研究者重提 DataScalar:90 年代被埋没的近数据计算架构 — lauriewired · 2026-10-02
- AAAI 主席发帖:审稿改革意在劝退「微小结果」论文 — tdietterich · 2026-10-02
- 评测者自述防刷榜心法:全量轮换题目+随时换方法论 — airesearch12 · 2026-10-02
- GOLLuM 回顾基准成绩:找 Top-5% 结果命中率 36.3% 胜描述符 29.7% — pschwllr · 2026-10-02
- 用语言模型学反应表征,多目标化学反应优化超越描述符方法 — pschwllr · 2026-10-02