前 OpenAI 研究员揭秘:推理模型训练靠海量思维链合成数据加 RL

yoavgo · x · 2026-09-26

Łukasz Kaiser 在与 Yoav Goldberg 的讨论中透露,推理模型训练大量依赖合成数据:流程是把海量模型推理轨迹(reasoning traces)交给另一个模型清洗、总结,过程中结合大量人工提示与领域知识进行过滤,再用这些数据训练并继续做 RL。

Yoav Goldberg 进一步追问两点:一是「人工提示」和「领域知识」在其中起到的作用有多大;二是这些能力能否泛化——是否应假设模型在某个任务/领域上表现出色,就说明它恰好在该领域做过针对性的 RL 与领域数据注入。Kaiser 的回答确认了这条合成数据+RL 的训练路径是主流做法。

所属事件:Goldberg 质疑 LLM 推理能力来源,Kaiser 揭合成数据路线(11 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →