800 个模型实验:混入 AI 文本预训练反而不如不加新数据

MohitIyyer · x · 2026-10-02

Mohit Iyyer 转发并总结了一项关于「AI 生成文本对预训练影响」的 scaling law 研究(引用 @jennajrussell 的线程):

这项工作为数据污染问题提供了系统性的定量证据,随 AI 文本占比持续攀升,问题正变得更加紧迫。

所属事件:800 模型实验:AI 文本污染网络语料反噬预训练(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →