纽约时报等要求制裁OpenAI隐瞒证据

围绕 ChatGPT 的版权诉讼,争议已从“训练了什么、生成了什么”升级到“OpenAI 是否隐瞒证据”。《纽约时报》及其他原告要求联邦法院制裁 OpenAI,称其在训练数据、聊天日志可检索性等关键问题上作出误导性说明,这直接关系到原告能否证明模型复现了受版权保护内容。

争议焦点

帖文显示,共有 17 家出版商加入制裁请求。原告称,后续证词——包括一名 OpenAI 工程师在 4 月的证词——显示,OpenAI 早已具备搜索相关数据的能力,并且在《纽约时报》起诉前就开始积累后来形成去标识化聊天日志数据库的数据。被提及的规模包括 7800 万条聊天记录。原告据此主张,OpenAI 不仅隐瞒了这部分证据,也在法庭上淡化了自己建立和检索此类数据库的能力。

《纽约时报》要求获取聊天日志,是为了证明 ChatGPT 的输出会复现其受版权保护的新闻内容,这些内容可能来自训练数据,也可能来自联网搜索。OpenAI 此前则向法院表示,提供这类材料会伤害用户隐私,而且去标识化处理负担很大。原告认为,后续证词削弱了这些说法的可信度。

制裁请求与回应

根据帖文,原告申请的制裁包括金钱制裁,并要求法院禁止 OpenAI 在抗辩中使用一份 2000 万条去标识化聊天日志样本。OpenAI 曾尝试只提交这份样本,但有帖子称法院认为其内容被严重涂黑,几乎“不可用”。

OpenAI 否认相关指控。转引报道中的公司立场是,这些说法“明显虚假”,并反指《纽约时报》试图获取私人用户数据。

影响

这场争议的重要性已不只在于模型是否输出了侵权内容,也在于法院能否穿透 AI 公司的内部数据流程,审查其日志留存、去标识化与检索能力;而 OpenAI 以隐私和技术负担为由的抗辩,是否会因后续证词而受到更严格审视,也成为后续看点。

2026-07-10 ~ 2026-07-10 · 12 条相关

事件全程(共 3 集)→

一手来源

另有 2 条近重复转述:RebeccaBellan · RebeccaBellan