研究揭示多阶段 SFT 损害推理能力,提出并行 RL 新范式

burny_tech · x · 2026-08-11

一项新研究分析了大模型在多任务训练中的表现,发现多阶段的监督微调(SFT)会引发任务冲突,从而降低模型在各项任务上的推理能力。

相比之下,强化学习(RL)的梯度更新更加稀疏且接近正交状态,使得不同任务能和平共存。基于此,研究者提出了一种将多任务训练解耦的 Parallel-RL 范式。

所属事件:新研究揭示多阶段SFT易致任务冲突,RL更具优势(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →