OpenAI「不排除用脱敏数据训练」引爆抢发质疑
OpenAI承认「无法排除脱敏后的产品使用数据被用于改进模型」后,一场围绕训练数据伦理与学术成果归属的争论在研究者社区迅速发酵。起因是用户irldanB抱怨OpenAI只要剥离身份信息,就能从他与ChatGPT一年多协作产生的、他自认为堪比千禧年大奖/菲尔兹奖水准的代码记录中学习,并在传闻他即将完成之际抢先把成果做出来,他提到Anthropic曾有类似案件。以色列NLP学者Yoav Goldberg点出核心区分:「我接受模型用我的数据训练并公开发布」与「我接受用我最新成果训练的内部模型抢发解题」完全是两回事;Boaz Barak补充称用户可选择退出(去标识化)数据用于训练。
已确认
- OpenAI在祝贺数学家Levent Alpöge与Tristan Buckmaster成果时声明,其研究与agent在成果公开发布前未曾见过对方工作,但补充不能排除产品使用产生的去标识化数据帮助改进了模型。
- 有用户指出OpenAI在8月28日开始训练更新的模型,但讨论者认为这不太可能影响相关研究结论,还涉及模型变体、微调及内部使用不同训练阶段模型等细节。
- Boaz Barak表示用户可选择退出(去标识化)数据用于训练。
争议与质疑
- 安全研究者davidmanheim质问OpenAI为何不给出事实真相:要么没有工具追踪自己训练了什么数据(不可接受),要么有工具却拒绝公开(更糟)。
- 开发者ctjlewis认为厂商本就不该承诺对话不被用于训练,OpenAI的「过度诚实」恰恰暴露其无法保证;他断言过去几个月任何人与GPT聊过的内容、发表的论文都已进入上一轮训练。
- 研究者gleech评论称OpenAI的真实处境可能是「自动用到了这些数据,并非有意为之,但无法证明其未影响结果——因为深度学习不是一门科学」,他认为这大概率属实但对OpenAI极为不利。
为什么重要
- 该争议触及AI厂商与用户/研究者之间的根本信任问题:训练数据不可追溯使得「是否用某人成果抢发」几乎无法证伪,这对依赖公开渠道协作的学术研究构成实质威胁。
2026-09-09 ~ 2026-09-09 · 9 条相关
一手来源
- Yoav Goldberg:允许训练数据≠允许拿去抢发我的研究成果 — yoavgo ·
- 安全研究者质问 OpenAI:训练数据要么不可追溯,要么不愿公开 — davidmanheim ·
- 研究员:OpenAI 难证训练数据未影响结果,深度学习非科学 — gleech ·
- OpenAI新模型8月28日开始训练,安全研究争议再起 — tilmanbayer · 2026-09-09
- 【源头】安全研究者质问 OpenAI:训练数据要么不可追溯,要么不愿公开 — davidmanheim · 2026-09-09
- 用户指控 OpenAI 默认用对话数据训练,质疑其抢发研究成果 — max_paperclips · 2026-09-09
- 开发者直言:所有实验室都在用你的研究训练模型,这事毫无意义 — ctjlewis · 2026-09-09
- 网友谈大模型训练数据:人人都被拿去训练了,别指望豁免 — ctjlewis · 2026-09-09
- 【源头】Yoav Goldberg:允许训练数据≠允许拿去抢发我的研究成果 — yoavgo · 2026-09-09
- 数学家抗议:同意数据训练不等于同意 AI 抢先解出我的成果 — PMinervini · 2026-09-09
- 【源头】研究员:OpenAI 难证训练数据未影响结果,深度学习非科学 — gleech · 2026-09-09
- Yoav Goldberg 炮轰 OpenAI「不排除」:等于承认数据进过训练管线 — MannyKayy · 2026-09-09