SFT 可能毁掉 RL 起点:微软 TailSFT 论文称 pass@1 最高提升 3.93 个百分点

rohanpaul_ai · x · 2026-09-04

微软与加州大学圣地亚哥分校的新论文指出:标准 SFT 虽让模型评测分数更好看,却可能抹掉 RL 阶段赖以强化的稀有正确行为,反而让模型成为更差的 RL 起点。

TailSFT 的做法:在 SFT 中过滤掉那些相对基座模型 loss 已大幅下降的序列,把训练重心移向模型仍未拟合的「尾部」数据,目标是让正确回答在重复采样下保持可达。

效果:在 OLMo-3 7B 上,数学与代码评测的 pass@16 最高绝对提升 17%,计算开销极小;相同 RL 设置下,后续 GRPO 的 pass@1 最高绝对提升约 4%(最高 3.93 个百分点)。论文还给出判断 TailSFT 何时有效的轻量诊断方法。

所属事件:微软 TailSFT 论文:过滤样本做 SFT 可提升 RL 后表现(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →