SFT 和 RL 的差别
ZainHasan6 · x · 2026-07-20
这条帖在解释 SFT 和 RL 对 LLM 的作用差异。
- 作者把 SFT 描述为:让模型学习一套固定的、标准答案式的解题步骤顺序。
- RL 则被解释为:在保留这些步骤的前提下,学会重新排列它们,从而解决新的问题。
- 关键观点是:如果 SFT 已经覆盖了所有可能的顺序,RL 的收益可能会很小。
- 真正带来提升的场景,是把 RL 用在 OOD(分布外)顺序 上,让模型在训练没见过的组合里也能泛化。
「研究」频道最新
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- OpenAI 与 Apollo 推出 Contrastive SDF 量化奖赏投机 — OpenAI · 2026-07-22
- NVIDIA:先调好 Harness,再去调模型 — NVIDIAAI · 2026-07-22
- AI 发展的瓶颈:从互联网数据红利到高质量反馈闭环 — dyamins · 2026-07-22
- NVIDIA 公布 22 篇 SIGGRAPH 论文与机器人仿真工具 — facontidavide · 2026-07-22
- 不用图数据库构建知识图谱,成本比GraphRAG低1000倍 — TheRedfather · 2026-07-22