John Schulman:用户数据训练对数学等前沿能力贡献极小
soumitrashukla9 · x · 2026-09-11
前 OpenAI 联合创始人、现任 Thinking Machines 的 John Schulman 就「用用户数据训练模型」发表了细致分类分析:
- 用户数据对前沿能力贡献有限:数学等领域能力提升主要来自预训练规模扩大和 RLVR,而非用户数据;用户数据更可能用于发现失败模式或难以为雇用标注员复现的场景。
- 三种训练方式风险迥异:① 以用户 token 为预测目标做预训练——regurgitation(复述泄露)风险高;② 用用户 prompt 蒸馏大模型到小模型——复述风险低;③ 用用户轨迹构建 RL 任务——复述风险低(RL 记忆能力弱),但可能提取客户 IP,从「把显式反馈用于奖励模型训练」到较侵入式的做法不等。
- 呼吁行业规范:各公司训练用户数据的激进程度差异很大(上传代码库并非假设情况),他希望有更强的披露规范——用什么方法、提升什么能力。
这是对当日相关新闻的补充观点,核心是:AI 公司普遍不愿披露用户数据训练方式,而不同方式对隐私和 IP 的影响截然不同。
「模型」频道最新
- OpenAI 传闻将宣布解决千禧年难题,ChatGPT Pro 疑因需求过高暂停 — kimmonismus · 2026-09-11
- OpenAI 向美国认证临床医生免费开放 GPT-6 Astra 专业版 — thekaransinghal · 2026-09-11
- OpenAI 疑变相停售 200 美元 Pro 20x 档,老用户成保护对象 — johnseach · 2026-09-11
- 新模型引入 engram 与 mHC 简化,社区追问预训练细节 — stochasticchasm · 2026-09-11
- Grok 4.6 突然变慢,社区猜测 Grok 4.7 即将发布 — DanielLockyer · 2026-09-11
- DeepSeek 4.1 Flash 被比作德国土耳其烤肉:便宜到挤占一切 — intellectronica · 2026-09-11