新论文揭示:多阶段SFT会引发灾难性遗忘,RL更具优势

joecole · x · 2026-08-12

一篇最新论文深入对比了监督微调(SFT)与强化学习(RL)在多任务训练中的表现差异。

所属事件:新研究揭示多阶段SFT易致任务冲突,RL更具优势(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →