专题 · FULL STORY

OpenAI 数据政策风波:输入被训练引争议

OpenAI 承认无法排除脱敏后的用户输入被用于模型训练,加之纳维-斯托克斯成果署名争议,引发研究者社区对训练数据伦理与学术成果归属的持续质疑与讨论。

2026-09-09 ~ 2026-09-09 · 2 集 · 15 条

第 1 集 · OpenAI数据政策遭围剿:研究者疑输入被偷偷训练(2026-09-09,12 条)

OpenAI承认「无法排除脱敏后的产品使用数据被用于改进模型」后,一场围绕训练数据伦理与学术成果归属的争论在研究者社区迅速发酵。起因是用户irldanB抱怨OpenAI只要剥离身份信息,就能从他与ChatGPT一年多协作产生的、他自认为堪比千禧年大奖/菲尔兹奖水准的代码记录中学习,并在传闻他即将完成之际抢先把成果做出来,他提到Anthropic曾有类似案件。目前OpenAI仅作「不能排除」的模糊表态,多方研究者指出训练数据不可追溯使该指控几乎无法证伪。

已确认

  • OpenAI在祝贺数学家Levent Alpöge与Tristan Buckmaster成果时声明,其研究与agent在成果公开发布前未曾见过对方工作,但补充不能排除产品使用产生的去标识化数据帮助改进了模型。
  • Boaz Barak表示用户可选择退出(去标识化)数据用于训练。
  • 有用户指出OpenAI在8月28日开始训练更新的模型,但讨论者认为这不太可能影响相关研究结论,还涉及模型变体、微调及内部使用不同训练阶段模型等细节。

争议与质疑

  • Yoav Goldberg点出核心区分:「我接受模型用我的数据训练并公开发布」与「我接受用我最新成果训练的内部模型抢发解题」完全是两回事。
  • 密码学家Matthew Green表示,他从同领域多位研究人员处听到共同观察:模型在短时间内针对他们各自的具体问题变得明显更好,即使换新方式提问也一样,多位研究者因此怀疑模型正在用他们的输入做训练。
  • 安全研究者davidmanheim质问OpenAI为何不给出事实真相:要么没有工具追踪自己训练了什么数据(不可接受),要么有工具却拒绝公开(更糟)。
  • 开发者ctjlewis认为厂商本就不该承诺对话不被用于训练,OpenAI的「过度诚实」恰恰暴露其无法保证;他断言过去几个月任何人与GPT聊过的内容、发表的论文都已进入上一轮训练。
  • 研究者gleech评论称OpenAI的真实处境可能是「自动用到了这些数据,并非有意为之,但无法证明其未影响结果——因为深度学习不是一门科学」,他认为这大概率属实但对OpenAI极为不利。

为什么重要

  • 该争议触及AI厂商与用户/研究者之间的根本信任问题:训练数据不可追溯使得「是否用某人成果抢发」几乎无法证伪,这对依赖公开渠道协作的学术研究构成实质威胁。Green转述的现象若属实,意味着此类情况可能并非孤例,而是研究者群体中的普遍疑虑。

第 2 集 · 纳维-斯托克斯争议引思考:碎片想法被聚合训练,署名权成难题(2026-09-09,3 条)

围绕 OpenAI 纳维-斯托克斯结果与数学家 Tristan Buckmaster、Levent Alpöge 的争议,社区开始反思:OpenAI 等公司正把用户公开发表的半成品想法聚合起来训练模型。有研究者建议,若你研究的问题预期前沿 AI 实验室在你有生之年就能攻克,应在数据授权设置中禁止用自身数据训练模型;而思想扩散本是好事,真正难题在于署名与归属。