新研究揭示多阶段SFT易致任务冲突,RL更具优势

中科院自动化所等机构的新研究深入对比了大模型多任务训练机制。研究发现,多阶段监督微调(SFT)因参数更新幅度大且高度重叠,会引发严重的任务冲突和“灾难性遗忘”,损害模型推理能力。相比之下,强化学习(RL)的梯度更新更稀疏且接近正交,能让多任务和平共存,展现出显著的优势,为多任务训练提供了新范式。

2026-08-10 ~ 2026-08-12 · 4 条相关

另有 2 条近重复转述:burny_tech · burny_tech