业内默认聊天记录会进训练集,连「不训练你的数据」都难自证
ivan_bezdomny · x · 2026-09-16
ivantbezdomny 指出一个尴尬现实:无论技术真相如何,大家现在都默认与 Claude、ChatGPT 的对话会泄漏进训练数据。引用帖给出两条可行的间接训练路径:
- 蒸馏用户 prompt:拿用户的提问生成答案,再用这些问答训练更小的模型——法律上不算「用你的数据训练」,效果却等同。
- 把聊天记录当作未来模型的 RL 环境使用,同样绕开字面上的「训练数据」定义。
作者自嘲式补充:他反而相信 Zuck 说 Meta 不这么干——但 Meta 也算不上前沿实验室。整条是对「我们不使用你的数据训练」这一公关叙事的实质质疑。
「模型」频道最新
- 自述 ChatGPT 联合发明者推出 Jev:宣称快 20-200 倍、便宜 40-400 倍 — lateinteraction · 2026-09-16
- DeepSeek v4.1 Flash 实测:5亿 token 不到 3 美元,解码峰值 315 tok/s — gaganghotra_ · 2026-09-16
- 爆料称 OpenAI 将于周四发布 GPT-6 Sol — mark_k · 2026-09-16
- Image-to-WebDev 榜更新:GPT-6 Astra 居首,GLM-5.3-Flash 性价比惊艳 — arena · 2026-09-16
- 「波将金式理解」研究:LLM 能背定义却在实例识别上崩盘 — anselm · 2026-09-16
- Astra 已显过时:内部神秘模型被指「显然是 AGI」 — flowersslop · 2026-09-16