SFT+RL为何提升推理组合泛化

tw_killian · x · 2026-07-11

这篇论文研究了:为什么在后训练推理模型中,把 SFT 和 RL 结合起来往往效果最好。

作者提出,这种优势来自组合泛化:模型把推理看作由可复用的“原子模块”组合而成。论文用层级潜变量选择模型形式化这一点,并给出结论:

转发里还提到作者认为“推理创造力”可以理解为模型把已知技能重新组合来解决新问题。

所属事件:探秘后训练:SFT与RL如何提升模型推理组合泛化(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →