Microsoft's TailSFT: Filtered Fine-Tuning Improves RL Performance
A Microsoft and UCSD paper proposes TailSFT, which filters already-fitted samples before SFT to preserve rare correct behaviors. The approach improves post-RL pass@1 by up to 3.93 percentage points.
2026-09-04 ~ 2026-09-04 · 2 related posts
- TailSFT: Microsoft Paper Shows SFT Can Wreck RL Starting Points, Gains up to 4% pass@1 — rohanpaul_ai · 2026-09-04
- TailSFT Paper: Filtering Fitted Sequences in SFT Boosts Post-RL pass@1 by up to 4% — rohanpaul_ai · 2026-09-04