为躲避AI污染,AI公司疯抢旧书做训练数据
随着公开网络数据中混入大量合成文本,AI公司正转向大量收购旧印刷书籍,以获取更“干净”的训练语料。网页数据的噪声和重复问题日益严重,可能污染模型训练集并带来风险。相比之下,旧书几乎不含AI生成内容,因此成为高质量数据的新来源,反映出行业对纯净训练数据的争夺日益激烈。
2026-07-21 ~ 2026-07-23 · 2 条相关
- AI 公司转向收购旧书,只为躲开训练集里的 AI 垃圾 — CackleRooster · 2026-07-21
- AI 公司转向收购旧书,争抢更干净的训练数据 — marigo · 2026-07-23