TailSFT 论文:过滤已拟合样本做 SFT,RL 后 pass@1 提升最高 4%

rohanpaul_ai · x · 2026-09-04

arXiv 论文《TailSFT: Filtered Fine-Tuning Improves Post-Training Performance》,作者包括 Sadhika Malladi、Samy Jelassi 等(微软)。核心观点:RL 后训练的效果依赖基座模型的覆盖度与 pass@K,而现有 SFT 流程可能产出不适合 RL 的检查点。

方法:TailSFT 在 SFT 期间过滤掉模型已经拟合好的序列,把学习集中在数据分布的「尾部」欠拟合区域,并通过受控实验与理论分析验证了过滤标准。

结果:在 OLMo-3 7B 上,数学与代码评测 pass@16 最高绝对提升 17%,开销极小;后续 GRPO 中 pass@1 最高绝对提升 4%。论文还提出识别 TailSFT 适用场景的轻量诊断,主张「阶段感知」的模型开发:用对 RL 的适配度来评判中间检查点。

所属事件:微软 TailSFT 论文:过滤样本做 SFT 可提升 RL 后表现(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →