微软 TailSFT 提升代码 pass@16 达 16.8 点
dair_ai · x · 2026-08-31
微软研究人员提出 TailSFT 方法,旨在改进标准 SFT 流程以更好地支持 RL。
- 问题:标准 SFT 会持续在模型已拟合的序列上消耗梯度,导致后续 RL 需要探索的分布变窄。
- 方法:TailSFT 在训练中过滤掉这些已拟合序列,将学习集中在数据中建模不足的长尾部分。
- 结果:在 OLMo-3 7B 上,代码 pass@16 绝对值提升达 16.8 点,数学提升 3.1 点。更高覆盖率的检查点使 GRPO 后的最终 pass@1 最多提升 3.9 点,且在某些设置下早期奖励爬升速度比标准 SFT 快 2.5 倍。
「研究」频道最新
- NeurIPS 2026 资源感知 Agent 研讨会征稿截止 — lupantech · 2026-09-01
- 英伟达推出 ADEPT:机器人仿零样本迁移现实 — dr_alphalyrae · 2026-09-01
- 讨论拟人化描述 AI 的利弊与隐喻价值 — AndrewLampinen · 2026-09-01
- UCLA 张恺伟分享 AI for Math 进展与经验 — kaiwei_chang · 2026-09-01
- Fal H3 Max 实现超实时无限视频生成,Agent 基础设施快速迭代 — Latent Space · 2026-09-01
- M1 Max 30秒生成新药分子,LiteMol模型演示低成本药物发现 — CatAstro_Piyush · 2026-09-01