微软 TailSFT 论文:过滤样本做 SFT 可提升 RL 后表现

微软与加州大学圣地亚哥分校发布论文《TailSFT: Filtered Fine-Tuning Improves Post-Training Performance》。论文指出标准 SFT 虽能提升评测分数,却可能抹掉 RL 阶段赖以强化的稀有正确行为,使模型成为更差的 RL 起点。TailSFT 通过过滤已拟合样本再做 SFT,使 RL 后 pass@1 最高提升约 4 个百分点(3.93)。

2026-09-04 ~ 2026-09-04 · 2 条相关