训练实践者复盘:SFT-souping-RL 交替是不错的探索-利用循环

tensorqt · x · 2026-10-07

训练实践者 @tensorqt 复盘自己的 RL 训练:回看认为本可以做得更多 SFT。训练曲线看起来混乱部分是因为它确实乱,但也因为他们发现交替使用 SFT - 模型 souping - RL 能形成不错的探索与利用循环。

这是来自一线训练者的经验之谈,讨论的是后训练配方的具体组合方式,对做 RL 微调的团队有参考价值。

所属事件:研究者探讨RL熵坍缩:视为势能消耗或靠SFT回注(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →