SFT多任务易冲突,RL能共存:大模型多任务学习机制揭示
CASIA · hf · 2026-08-10
自动化研究所(CASIA)的论文深入对比了监督微调(SFT)和强化学习(RL)在多任务推理中的表现差异。
研究发现,SFT 在多阶段训练中会出现严重的任务冲突,而 RL 则能实现跨任务的稳定共存。作者从参数层面追踪发现,RL 会在不同任务间引发稀疏且近似正交的参数更新。
理论上,SFT 的干扰受限于梯度范数,而 RL 的干扰受限于方差。基于这种较小的方差界限,RL 能够产生近乎正交的优化方向。据此,论文提出了 Parallel-RL 范式,解耦多任务训练,大幅提升了训练效率和灵活性。
「研究」频道最新
- 研究称 LLM 写 JS 比 TS 错误率更低,静态类型未必是代码护栏 — hichaelmart · 2026-08-10
- 269小时脑电数据训练,非侵入式语音解码准确率达61.3% — kaixhin · 2026-08-10
- 推测解码技术为何爆发?Tri Dao 等论文推动推理革命 — Ok-River5924 · 2026-08-10
- 3D 扫描实景训练人形机器人:零真实微调直接上岗 — lukas_m_ziegler · 2026-08-10
- 单模型搞定转写与分离:MOSS-Transcribe-Diarize — vanstriendaniel · 2026-08-10
- 哈佛与MIT开源MatrAIx:模拟全球83亿人行为 — SRSchmidgall · 2026-08-10