新研究揭示多阶段SFT易致任务冲突,RL更具优势
中科院自动化所等机构的新研究深入对比了大模型多任务训练机制。研究发现,多阶段监督微调(SFT)因参数更新幅度大且高度重叠,会引发严重的任务冲突和“灾难性遗忘”,损害模型推理能力。相比之下,强化学习(RL)的梯度更新更稀疏且接近正交,能让多任务和平共存,展现出显著的优势,为多任务训练提供了新范式。
2026-08-10 ~ 2026-08-12 · 4 条相关
- SFT多任务易冲突,RL能共存:大模型多任务学习机制揭示 — CASIA · 2026-08-10
- 新论文揭示:多阶段SFT会引发灾难性遗忘,RL更具优势 — joecole · 2026-08-12
另有 2 条近重复转述:burny_tech · burny_tech