探秘后训练:SFT与RL如何提升模型推理组合泛化

近期学术界多项研究深入探讨了在后训练推理模型中,将监督微调(SFT)与强化学习(RL)相结合往往能取得最佳效果的内在机制。研究者指出,这种性能提升的核心在于模型的“组合泛化”能力,即模型能够将推理过程视为由可复用的“原子模块”组合而成,进而展现出解决新问题的“推理创造力”。

SFT与RL的分工机制

从机制层面来看,SFT和RL在后训练中扮演着不同但互补的角色。@twkillian 总结的研究假设清晰地界定了三者的分工:预训练负责建立“可能概念”的总体分布,SFT向模型展示这些逻辑概念如何被排列组合,而RL则促使模型在面对新上下文和任务时探索新的概念排序。具体而言,SFT的作用是提供丰富的组合式推理轨迹,而RL则负责将这些复杂的轨迹分解为可独立调用的原子技能和路由策略。

RL如何驱动技能复用

在仅有最终答案奖励且缺乏中间步骤监督的情况下,RL依然能展现出强大的驱动力。@heghbalz 转发的研究指出,RL能够先强化模型原有的基础技能,随后将这些技能组合成更为复杂的推理过程,最终形成一个可以反复调用的技能库。控制实验表明,正是这种机制使得模型能够解出基座模型几乎无法解决的留出题(hold-out problems),并在未见过的组合与不同推理深度上表现出更强的泛化能力。

2026-07-10 ~ 2026-07-11 · 5 条相关

一手来源