前 OpenAI 研究员揭秘:推理模型训练靠海量思维链合成数据加 RL
yoavgo · x · 2026-09-26
Łukasz Kaiser 在与 Yoav Goldberg 的讨论中透露,推理模型训练大量依赖合成数据:流程是把海量模型推理轨迹(reasoning traces)交给另一个模型清洗、总结,过程中结合大量人工提示与领域知识进行过滤,再用这些数据训练并继续做 RL。
Yoav Goldberg 进一步追问两点:一是「人工提示」和「领域知识」在其中起到的作用有多大;二是这些能力能否泛化——是否应假设模型在某个任务/领域上表现出色,就说明它恰好在该领域做过针对性的 RL 与领域数据注入。Kaiser 的回答确认了这条合成数据+RL 的训练路径是主流做法。
所属事件:Goldberg 质疑 LLM 推理能力来源,Kaiser 揭合成数据路线(11 条相关)→
「研究」频道最新
- Anthropic 宣称 Claude 可算九圈散射振幅,物理学家质疑离公认理论尚远 — burny_tech · 2026-09-26
- 开源 Jevless:任意带 logprobs 的模型实现 Jev 式结构化决策 — seraphius · 2026-09-26
- 物理博客主披露为 Anthropic 写稿内幕:收费居中水平、拒签 NDA — burny_tech · 2026-09-26
- 论文《Mecha-nudges for Machines》入选 NeurIPS 2026 Spotlight — ethayarajh · 2026-09-26
- AutoScreen 用 AI 智能体重排 CRISPR 结果,湿实验证实癌细胞免疫逃逸基因 — KexinHuang5 · 2026-09-26
- 提示词修一处悄悄毁另一处:输出预算守恒导致无信号回归 — ClickOk5811 · 2026-09-26