SFT 与 RL 如何重组推理轨迹

tw_killian · x · 2026-07-10

这项研究从机制上分析了标准后训练中 SFT 和 RL 的作用:SFT 提供丰富的组合式推理轨迹,RL 则把这些轨迹分解成原子技能和路由策略。

控制实验显示,这种方法尤其能提升模型在未见过的组合与不同推理深度上的表现,说明模型可以复用熟悉的推理片段去解决陌生任务。

所属事件:探秘后训练:SFT与RL如何提升模型推理组合泛化(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →