为躲避 AI 语料污染,AI 公司正大量收购旧书版权
speckx · hn · 2026-07-21
据 404 Media 报道,AI 公司目前正大量购买旧书数据,因为这些早期出版的书籍未受现代 AI 生成内容的污染。
随着互联网上 AI 生成的“垃圾内容”泛滥,高质量、纯净的人类文本成为稀缺资源。为了获取干净的训练数据,各大模型厂商不得不转向传统出版物和旧书市场。
「漫话AGI」频道最新
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- 前 OpenAI、Anthropic 预训练研究员辞职:两公司正赌上人命冲向自我改进超级智能 — ShakeelHashim · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- AI 陪伴的隐秘代价:它消解了建立真实亲密关系所需的摩擦 — YogeshMalik · 2026-09-11
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 「幻觉」或是范畴错误:把 AI 叫智能正在限制我们的想象 — Genaforvena · 2026-09-11