DeepMind 提出 TailSFT:微调阶段为 RL 提效的轻量方法

canondetortugas · x · 2026-09-12

DeepMind 研究者 Sadhika Malladi 等提出 TailSFT,一种轻量且有原则的 SFT 改进方法,直接提升覆盖度并获得更好的 RL 后表现。

所属事件:DeepMind 与普林斯顿提出 TailSFT:为 RL 提效的微调新法(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →