微软 TailSFT 论文:过滤样本做 SFT 可提升 RL 后表现
微软与加州大学圣地亚哥分校发布论文《TailSFT: Filtered Fine-Tuning Improves Post-Training Performance》。论文指出标准 SFT 虽能提升评测分数,却可能抹掉 RL 阶段赖以强化的稀有正确行为,使模型成为更差的 RL 起点。TailSFT 通过过滤已拟合样本再做 SFT,使 RL 后 pass@1 最高提升约 4 个百分点(3.93)。
2026-09-04 ~ 2026-09-04 · 2 条相关
- SFT 可能毁掉 RL 起点:微软 TailSFT 论文称 pass@1 最高提升 3.93 个百分点 — rohanpaul_ai · 2026-09-04
- TailSFT 论文:过滤已拟合样本做 SFT,RL 后 pass@1 提升最高 4% — rohanpaul_ai · 2026-09-04