中美大模型训练路径分化:美国重RL,中国偏好SFT

业界观察到中美AI实验室在推理能力训练上出现明显路径分化:美国实验室更倾向使用强化学习(RL),而中国实验室则更频繁采用基于成功轨迹的监督微调(SFT),且同样具备竞争力。针对SFT路线,有开发者提议在微调前引入安全分类器,对推理轨迹进行过程级的安全与对齐筛选,从而训练出既有效又安全的推理模型。

2026-07-22 ~ 2026-07-22 · 4 条相关