New Paper Shows Multi-stage SFT Causes Catastrophic Forgetting While RL Excels

joecole · x · 2026-08-12

A new paper provides a focused comparison between Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL) in multi-task training.

Related event: Study Reveals Multi-stage SFT Causes Task Conflicts, Favoring RL(4 posts)→

Original post →

More from Research

Research channel →