为躲避AI污染,AI公司疯抢旧书做训练数据

随着公开网络数据中混入大量合成文本,AI公司正转向大量收购旧印刷书籍,以获取更“干净”的训练语料。网页数据的噪声和重复问题日益严重,可能污染模型训练集并带来风险。相比之下,旧书几乎不含AI生成内容,因此成为高质量数据的新来源,反映出行业对纯净训练数据的争夺日益激烈。

2026-07-21 ~ 2026-07-23 · 2 条相关