专题 · FULL STORY

Anthropic破坏性扫描实体书训练AI引争议

法庭文件泄露显示,Anthropic为训练Claude模型,对购买的数百万册实体书进行破坏性扫描后销毁原件。此举引发AI版权与“焚书”伦理争议。

2026-07-28 ~ 2026-07-31 · 3 集 · 27 条

第 1 集 · AI 训练版权争议折射知识获取方式变迁(2026-07-28,2 条)

围绕 AI 训练数据与版权的争议引发了关于知识获取方式变迁的讨论。观点指出,20 年前 Google Books 扫描绝版书受阻,如今大众却接受了通过 AI 阅读旧书。评论认为,如果当年扫描稀有书籍未被法律阻止,这些资料本可被非破坏性保存,而非被囤积居奇。

第 2 集 · AI 公司扫描稀有书籍后销毁原件引发“焚书”争议(2026-07-29,23 条)

近期法庭文件和媒体报道显示,Anthropic 等AI公司为了构建训练语料库,购买了数百万册实体书,切掉书脊进行“破坏性扫描”后销毁原书。这一做法引发了关于“AI焚书”和文化消失的愤怒,但多位分析人士指出,这种反直觉的做法本质上是版权法与法官裁定下的必然结果,凸显了AI训练数据获取与现行法律的深层矛盾。

已确认

  • 案件呈现出一种反直觉的法律切割:Anthropic 援引“首次销售原则”主张有权销毁合法购买的书;但从盗版书库抓取的 700 万本书不享有此保护,相关部分最终以 15 亿美元 和解。
  • 联邦法官裁定这种“彻底销毁实体书只保留电子版”的做法属于“合理使用”,因为销毁原件意味着同时不存在多个副本。法官的判决逻辑认为,只要训练过程中是“转移”文本而不是“复制”,就不构成版权侵权,但法律后果牵涉到书籍销毁。
  • 由于 2022 年以前出版的书籍不含 AI 生成文本,因此成为高价抢购的优质训练数据。

尚未确认

  • 有爆料称部分 AI 公司正大量收购稀有和绝版旧书进行销毁,但也有反驳观点指出,美国每年有 64 万吨 书籍进入填埋场,其中很多只是过时的电脑手册等,AI 公司将其再利用反而避免了资源浪费。

为什么重要

  • 这起案件凸显了当前 AI 训练数据获取与版权法之间的深层矛盾。正如 @alejandroll10 和 @iScienceLuvr 等作者所指出的,公众的愤怒可能被误导了:真正有问题的或许不是“扫描”或 AI 技术本身,而是迫使书籍必须被销毁的法律条款与法官裁定。
  • @Kevin Bankston 也认为,外界对“销毁书籍”的愤怒有些矫情,因为公司只是在顺应法院判例下的侵权风险逻辑,而今天批评公司的论点某种程度上正是当初推动这一局面的力量。
  • @aronchick 和 @heyabusiddik 补充了一个常被忽视的视角:美国每年有数十万吨废弃书籍被填埋或打浆,将其用于 AI 训练或许是一种更合理的再利用方式。
  • @beenwrekt 转述 Yoav Goldberg 的批评指出,现有版权机制迫使公司在扫描后销毁实体书且不能分享数字扫描件,这种极端限制反而不如直接盗版。

还有 3 条相关讨论 →

第 3 集 · 泄露文件曝Anthropic秘密扫描实体书训练模型(2026-07-30,2 条)

法庭泄露的内部文件显示,Anthropic 曾秘密推进“Project Panama”项目,对全球数百万乃至千万册实体书进行破坏性扫描以训练 Claude 模型。内部人员明确试图隐瞒此事。这一侵权行为最终引发了版权诉讼,Anthropic 可能面临高达 15 亿美元的史上最大版权和解案。