SFT多任务易冲突,RL能共存:大模型多任务学习机制揭示

CASIA · hf · 2026-08-10

自动化研究所(CASIA)的论文深入对比了监督微调(SFT)和强化学习(RL)在多任务推理中的表现差异。

研究发现,SFT 在多阶段训练中会出现严重的任务冲突,而 RL 则能实现跨任务的稳定共存。作者从参数层面追踪发现,RL 会在不同任务间引发稀疏且近似正交的参数更新。

理论上,SFT 的干扰受限于梯度范数,而 RL 的干扰受限于方差。基于这种较小的方差界限,RL 能够产生近乎正交的优化方向。据此,论文提出了 Parallel-RL 范式,解耦多任务训练,大幅提升了训练效率和灵活性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →