SFT+RL为何提升推理组合泛化
tw_killian · x · 2026-07-11
这篇论文研究了:为什么在后训练推理模型中,把 SFT 和 RL 结合起来往往效果最好。
作者提出,这种优势来自组合泛化:模型把推理看作由可复用的“原子模块”组合而成。论文用层级潜变量选择模型形式化这一点,并给出结论:
- SFT 负责提供覆盖面广的推理轨迹,让模型学到可复用的原子模块;
- RL 负责在这些模块上继续探索与重组,从而超出 SFT 分布,实现更强的组合泛化;
- 实验表明,最强结果通常出现在 SFT 提供足够广的覆盖,同时 RL 去探索新的组合 的情况下。
转发里还提到作者认为“推理创造力”可以理解为模型把已知技能重新组合来解决新问题。
所属事件:探秘后训练:SFT与RL如何提升模型推理组合泛化(5 条相关)→
「研究」频道最新
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 果蝇大脑 LLM 权重上架 Hugging Face,兼容 transformers 可直接跑 — ngxson · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11