中美大模型训练路径差异:美国重 RL,中国偏好 SFT

xuanalogue · x · 2026-07-22

有观察指出,中美 AI 实验室在推理能力训练上存在明显的路径分化:美国实验室更倾向于使用强化学习(RL),而中国实验室则更频繁地在成功的推理轨迹上进行监督微调(SFT),且后者同样具备极强的竞争力(如 Kimi K3 的表现就是侧面证据)。

所属事件:中美大模型训练路径差异与对齐新思路(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →