Lukas Kaiser 揭秘:清洗模型推理轨迹造合成数据再上 RL

lukaszkaiser · x · 2026-09-26

前 OpenAI 研究者 Lukas Kaiser 回应 Yoav Goldberg 对推理模型训练的困惑:训练流程大体已知,关键在于海量合成数据——取大量模型推理轨迹,让另一个模型进行清理和总结(配合大量人工提示、领域知识和过滤),再用这些数据训练,然后继续跑 RL。这解释了高质量推理轨迹与人类语言论证对齐的来源。

所属事件:Goldberg 等学者激辩:前沿模型超长推理链从何而来(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →