AI 公司转向收购旧书,只为躲开训练集里的 AI 垃圾
CackleRooster · reddit · 2026-07-21
帖子引述一篇文章称,AI 公司正在大量购买旧书,因为这些印刷书籍几乎不含 AI 生成内容。
其背后的理由是,今天可抓取的网页数据里已经混入越来越多的合成文本,可能污染训练集并引发“模型塌缩”。文章因此把 2022 年前出版的旧书视为更干净、更适合训练的数据来源。
「研究」频道最新
- 图计算工作负载 854.graph500 进入 SPEC CPU 2026 — Prof_DavidBader · 2026-07-22
- BlackboxNLP 2026 因投稿激增招募额外审稿人 — hanjie_chen · 2026-07-22
- UI2App 显示截图还原远落后于真实交互恢复 — Grace Man Chen · 2026-07-22
- Masked diffusion 语言模型提升 agentic RL 世界模型 — PatronusAI · 2026-07-22
- Fable 5 据称解开代数几何最著名难题之一 — we_are_mammals · 2026-07-22
- 斯坦福 HAI 用 PNAS 特辑梳理生成式 AI 法律问题 — StanfordHAI · 2026-07-22