中美推理模型训练路径分化与对齐新思路
近期,业界观察到中美 AI 实验室在推理模型训练范式上存在明显差异:美国实验室更倾向于使用强化学习(RL),而中国实验室则更频繁地采用基于成功轨迹的监督微调(SFT)。@goyalshaliniuk 与 @xuanalogue 指出,偏好 SFT 的路径同样具备极强的竞争力,近期表现出色的 Kimi K3 就是支撑这一观点的侧面证据。
已确认
关于训练路径的分化现象主要基于业界观察。@xuanalogue 提出,在微调前对模型推理轨迹进行过程级评估是可行的。具体而言,在对成功的推理轨迹进行 SFT 之前,除了常规的按“是否成功”进行过滤,还可以引入安全分类器(如 OpenAI 在部署中使用的分类器)来评估轨迹的对齐性,只保留既有效又安全的轨迹。
为什么重要
结合相关 RL 理论文的讨论,如果在微调前判断模型是否用正确方法达成目标,将有助于引导模型实现更安全的泛化。这种在 SFT 前进行过程级安全筛选的方法,有望在避免 RL 病态的同时,探索出训练安全对齐推理模型的新路径。
2026-07-22 ~ 2026-07-22 · 5 条相关
一手来源
- 美国实验室更偏 RL,中文实验室更偏成功轨迹 SFT — goyalshaliniuk ·
- 提议用安全分类器过滤推理轨迹,改进对齐 SFT — xuanalogue ·
- RL 理论文讨论过程级评估如何引导更安全的泛化 — xuanalogue ·
- 【源头】美国实验室更偏 RL,中文实验室更偏成功轨迹 SFT — goyalshaliniuk · 2026-07-22
- 中美大模型训练路径差异:美国重 RL,中国偏好 SFT — xuanalogue · 2026-07-22
- 【源头】提议用安全分类器过滤推理轨迹,改进对齐 SFT — xuanalogue · 2026-07-22
- SFT 前做过程级安全筛选或能训练更对齐的推理模型 — xuanalogue · 2026-07-22
- 【源头】RL 理论文讨论过程级评估如何引导更安全的泛化 — xuanalogue · 2026-07-22