训练实践者复盘:SFT-souping-RL 交替是不错的探索-利用循环
tensorqt · x · 2026-10-07
训练实践者 @tensorqt 复盘自己的 RL 训练:回看认为本可以做得更多 SFT。训练曲线看起来混乱部分是因为它确实乱,但也因为他们发现交替使用 SFT - 模型 souping - RL 能形成不错的探索与利用循环。
这是来自一线训练者的经验之谈,讨论的是后训练配方的具体组合方式,对做 RL 微调的团队有参考价值。
所属事件:研究者探讨RL熵坍缩:视为势能消耗或靠SFT回注(4 条相关)→
「研究」频道最新
- 研究「重新定义问题」的智能,米兰四校团队获 100 万欧元资助 — ValerioCapraro · 2026-10-07
- AI 编码该复用开源还是从零写?Weaviate 播客激辩系统设计 — CShorten30 · 2026-10-07
- 189 人 VR 实验发现:同为 AI 助手,女性形象获得的信任与分配金额少 10% — derrikson · 2026-10-07
- 学者激辩:计算机是符号计算器还是大脑能力放大器 — AndrewLampinen · 2026-10-07
- 苹果论文:单 Agent 加 Shell 胜过多 Agent 编排,Kaggle 奖牌率 62.5% 对 47.1% — rohanpaul_ai · 2026-10-07
- Chan Zuckerberg 生物中心办首届 AIxBio 大会聚焦 AI for Science — lucapinello · 2026-10-07