DeepMind 与普林斯顿提出 TailSFT:为 RL 提效的微调新法

Sadhika Malladi 等来自 DeepMind 与 Princeton 的研究者在 arXiv 发表《The Coverage Principle》,提出 TailSFT:一种轻量且有原则的 SFT 改进方法,用尾部加权替代传统交叉熵 SFT,直接提升覆盖度,使 RL 后模型性能更强。团队此前已证明交叉熵 SFT 并非 RL 前的最佳准备方式,而 RL 训练成本高昂,每一步都应有效,TailSFT 正是针对这一痛点的设计。

2026-09-12 ~ 2026-09-12 · 3 条相关