新论文揭示:多阶段SFT会引发灾难性遗忘,RL更具优势
joecole · x · 2026-08-12
一篇最新论文深入对比了监督微调(SFT)与强化学习(RL)在多任务训练中的表现差异。
- 多阶段SFT导致学习崩溃:当模型在数学、代码、逻辑等任务上依次进行SFT时,新任务的训练会覆盖旧参数,导致严重的“灾难性遗忘”。这也是为什么常规SFT必须在混合批次中并行训练所有数据集。
- RL表现更优:相比之下,RL训练产生的权重更新接近正交,有效缓解了遗忘问题,整体表现更好。
所属事件:新研究揭示多阶段SFT易致任务冲突,RL更具优势(4 条相关)→
「研究」频道最新
- 研究发现:推理模型思考越深,越不爱向人类提问澄清 — xuanalogue · 2026-08-12
- 开源数据集实测:AI 究竟加速了哪些领域的科学发现? — soumitrashukla9 · 2026-08-12
- AI 自动研究工具已上线半年,算法效率未见明显加速 — soumitrashukla9 · 2026-08-12
- 研究揭示 Grok 模型家族的人格演变轨迹 — DevDminGod · 2026-08-12
- STACX: 端到端智能体强化学习模块化基础设施 — daibond_alpha · 2026-08-12
- NeurIPS 2026研讨会:构建医疗高风险领域的世界模型 — yaringal · 2026-08-12