中美大模型训练路径分化:美国重RL,中国偏好SFT
业界观察到中美AI实验室在推理能力训练上出现明显路径分化:美国实验室更倾向使用强化学习(RL),而中国实验室则更频繁采用基于成功轨迹的监督微调(SFT),且同样具备竞争力。针对SFT路线,有开发者提议在微调前引入安全分类器,对推理轨迹进行过程级的安全与对齐筛选,从而训练出既有效又安全的推理模型。
2026-07-22 ~ 2026-07-22 · 4 条相关
- 美国实验室更偏 RL,中文实验室更偏成功轨迹 SFT — goyalshaliniuk · 2026-07-22
- 中美大模型训练路径差异:美国重 RL,中国偏好 SFT — xuanalogue · 2026-07-22
- 提议用安全分类器过滤推理轨迹,改进对齐 SFT — xuanalogue · 2026-07-22
- SFT 前做过程级安全筛选或能训练更对齐的推理模型 — xuanalogue · 2026-07-22