TailSFT:用尾部加权 SFT 提升覆盖度,让强化学习每一步更值

canondetortugas · x · 2026-09-12

Sadhika Malladi 团队提出 TailSFT:鉴于 RL 训练成本高昂、每一步都应有效,团队一年前已证明交叉熵 SFT 并非 RL 前的最佳准备方式,如今提出这种轻量且有原则的方法,直接提升数据覆盖度,从而在 RL 后获得更好的性能。相关工作基于 OLMo,获得 finbarrtimbers 等研究者转发肯定。

所属事件:DeepMind 与普林斯顿提出 TailSFT:为 RL 提效的微调新法(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →