SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai, Kang Liu, Juanzi Li, Jun Zhao
cs.CL, cs.LG
2026-08-04
多任务连训里 SFT 掉 23.1%、RL 涨 24.9%,差距在 RL 参数更新稀疏且近正交;据此提出并行训练再合并的 Parallel-RL,保住单任务水平。
给大模型做多任务后训练时,业界常用两种范式:监督微调(SFT)和强化学习(RL)。一个普遍的痛点是把多个任务串起来连训时,后一个任务会冲掉前一个任务的能力,所谓灾难性遗忘。这篇要回答的是:为什么 SFT 连训冲突严重,而 RL 连训却能稳稳共存?
作者先在 DeepSeek-R1-Distill-Qwen-1.5B 上做了对照。同一组任务(数学、科学、逻辑、代码),SFT 多阶段连训后平均比原模型掉 23.1%,其中 logic 单项掉 22 个点;RL 多阶段连训反而平均涨 24.9%,而且每个任务都涨。这个反差足够大,值得追到底。
他们把分析下沉到参数层面,再给出理论解释,最后提出训练范式。
参数层面的观察。同一个模型在不同任务上分别做一步训练,看参数更新 ΔW。RL 的更新有两个特征:ΔW 的 L2 范数,RL 只有约 3×10⁻²,SFT 约 7.4,差了两个数量级;RL 更新高度稀疏,只动一小撮参数。更关键的是任务间的余弦相似度:SFT 不同任务的 ΔW 余弦约 10⁻¹(方向明显重叠),RL 约 10⁻³(几乎正交)。方向不重叠,优化就不会互相踩。
理论解释。他们把任务间梯度的干扰写成上界,发现两种范式的干扰来源不同。SFT 的干扰是 norm-limited 的,上界正比于梯度本身的大小:梯度越大、更新越密,干扰越大,这符合它大范数、高重叠的表现。RL 的干扰是 variance-limited 的,上界由 advantage 归一化后的梯度方差决定。RL 里 advantage 是零和的(同一批里正负抵消),把梯度的均值方向整体消掉,剩下的只有组内残差;残差方差小,又因为高维空间里稀疏零均值向量天然趋于正交,任务间干扰被压到很低。
Parallel-RL 范式。既然不同任务的 RL 更新近似正交,⟨ΔWᵢ, ΔWⱼ⟩ 约等于 0,那么把任务拆开各训各的、再把更新加回去,就近似等价于串行连训,但可以并行。合并方式有三种:直接求和、用 TIES 或 SVD 做稀疏合并、合并后再用少量数据(原训练量的 5%)快速适应。Adapted 版效果最好。
基座是 DeepSeek-R1-Distill-Qwen-1.5B 和 7B,任务覆盖 MATH500/AIME2025、MMLU/GPQA、Knights and Knaves、LiveCodeBench。
| 范式 | 1.5B 平均(相对原模型) |
| 多阶段 SFT | -23.1% |
| 多阶段 RL | +24.9% |
| 混合数据 RL | +12.6% |
单任务训练的迁移:SFT 在目标任务涨 4.0%、未训练任务掉 5.1%;RL 目标任务涨 6.8%、未训练任务反而涨 2.3%(正向迁移)。参数更新上 RL 的 ΔW L2 范数约 3×10⁻²,SFT 约 7.4。
Parallel-RL(1.5B,GRPO):直接求和版本保住单任务 RL 水平的 94.2%、TIES 合并 97.4%、Adapted 版 102.8%(7B 上 102.4%)。消融里删掉某个任务的更新,目标任务掉 7.1%、其他任务涨 0.6%,说明各任务能力确实被解耦了。
这篇把一个工程直觉(RL 比 SFT 更耐多任务)讲成了可解释的机制:正交性来自 advantage 的零和结构,不是玄学。对实际后训练的指导很直接:任务之间如果用 SFT 会打架,换成 RL、或者干脆拆成并行任务再合并,可以避开串行遗忘。Parallel-RL 让多任务训练从排队变成并行,省 wall-clock,也能灵活增删任务。
要诚实说清边界:混合数据(多任务混进同一个 batch)的 RL 增益只有 12.6%,低于多阶段的 24.9%,作者归因于任务间梯度不均衡,但承认这并非本文重点。也就是说,正交性是在分任务前提下成立,真把任务混进同一批数据,机制会变复杂。
作者自述的局限比较薄,只说混合数据 RL 增益偏低、且需要判断哪些任务适合并行。读下来更该追问的:正交性的论证主要建立在 GRPO 这一类 advantage 零和的算法上,换了 reward 不零和、或者 advantage 不归一化的 RL 变体,variance-limited 这个上界还成不成立?论文把理论推广到 PPO(给了 PPO 的干扰上界定理),但实验验证集中在 GRPO。另外所有数字都在 1.5B/7B 的蒸馏模型上,放到更大参数或非蒸馏模型是否一致,没有验证。