预训练 800 个模型揭示:AI 生成文本过量反而损害语言模型训练

pangram · hf · 2026-10-01

Pangram 团队研究网络预训练数据中日益增多的 AI 生成文本的影响。经 FineWeb 过滤后,2026 年 6 月网络数据中 27.5% 的 token 被判定为 AI 生成,8 月升至 31.1%。

所属事件:800 模型实验:AI 文本污染网络语料反噬预训练(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →