SFT 可能毁掉 RL 起点:微软 TailSFT 论文称 pass@1 最高提升 3.93 个百分点
rohanpaul_ai · x · 2026-09-04
微软与加州大学圣地亚哥分校的新论文指出:标准 SFT 虽让模型评测分数更好看,却可能抹掉 RL 阶段赖以强化的稀有正确行为,反而让模型成为更差的 RL 起点。
TailSFT 的做法:在 SFT 中过滤掉那些相对基座模型 loss 已大幅下降的序列,把训练重心移向模型仍未拟合的「尾部」数据,目标是让正确回答在重复采样下保持可达。
效果:在 OLMo-3 7B 上,数学与代码评测的 pass@16 最高绝对提升 17%,计算开销极小;相同 RL 设置下,后续 GRPO 的 pass@1 最高绝对提升约 4%(最高 3.93 个百分点)。论文还给出判断 TailSFT 何时有效的轻量诊断方法。
所属事件:微软 TailSFT 论文:过滤样本做 SFT 可提升 RL 后表现(2 条相关)→
「研究」频道最新
- 用 Claude 在机器人上跑完整科学实验:10 分钟生成协议当天上机 — yawnxyz · 2026-09-04
- 深度学习 RNA 设计登 Science 封面,AI 可自动设计 RNA 假结结构 — rishabh16_ · 2026-09-04
- 753B 模型思考、4B 模型执笔:潜空间协作实现 20 倍提速 — burny_tech · 2026-09-04
- Vals AI 发布 SRE-Bench:考验模型逆向工程二进制文件的新安全基准 — dyn___ · 2026-09-04
- 研究称涌现性对齐失效可预测,本质是泛化而非"邪恶人格" — burny_tech · 2026-09-04
- 研究者指出 RL 驱动的 AI 进展难以覆盖真正分布外泛化 — chris_j_paxton · 2026-09-04