新论文揭示多任务训练机制:SFT 易冲突,RL 能和平共存

burny_tech · x · 2026-08-11

一篇新论文从理论和实证角度分析了大模型(LLM)多任务学习中的冲突现象。研究发现,监督微调(SFT)在多阶段训练中存在严重的任务冲突,因为其参数更新幅度大且高度重叠,容易导致学习新任务时覆盖旧知识。

相比之下,强化学习(RL)诱导的参数更新是稀疏且近似正交的,使得各项能力得以和平共存且互不干扰。论文指出,SFT 的干扰受限于梯度范数,而 RL 的干扰则被优势归一化带来的梯度方差所限制。基于此,作者提出了 Parallel-RL 范式,通过解耦多任务训练显著提升了效率与灵活性。

所属事件:新研究揭示多阶段SFT易致任务冲突,RL更具优势(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →