RL为何能提升SFT后的推理
burny_tech · x · 2026-07-12
这条转发在解释一篇论文对“为什么 RL 会在 SFT 之后改善推理”的看法:
- SFT 往往直接给出完整解题过程,但其中真正有用的部分会被混在一起,模型学到的是一团难以拆分的整体。
- RL 通过奖励引导下的变异,帮助模型把这些信息拆成更可复用的技能和路由规则。
- 这样之后,模型就能在 SFT 没见过的新问题上,把这些技能重新组合起来。
「研究」频道最新
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11