TailSFT: skip already-learned SFT examples to boost post-RL pass@k

canondetortugas · x · 2026-09-12

Related event: DeepMind and Princeton Propose TailSFT to Boost RL Performance(3 posts)→

Original post →

More from Models

Models channel →