800 模型实验:AI 文本污染网络语料反噬预训练

Pangram 团队发布一项 scaling law 研究,通过预训练约 800 个语言模型,量化网络爬取语料中日益增多的 AI 生成文本对预训练的影响。用 Pangram 检测器标注发现,经 FineWeb 质量过滤后的网络数据中,2026 年 6 月有 27.5% 的 token 被判定为 AI 生成,8 月已升至 31.1%。对数据充足的模型,混入 AI 文本反而推高损失。

已确认

为什么重要

2026-10-01 ~ 2026-10-02 · 5 条相关

一手来源

另有 2 条近重复转述:pangram · MohitIyyer