DeepMind 与普林斯顿提出 TailSFT:为 RL 提效的微调新法
Sadhika Malladi 等来自 DeepMind 与 Princeton 的研究者在 arXiv 发表《The Coverage Principle》,提出 TailSFT:一种轻量且有原则的 SFT 改进方法,用尾部加权替代传统交叉熵 SFT,直接提升覆盖度,使 RL 后模型性能更强。团队此前已证明交叉熵 SFT 并非 RL 前的最佳准备方式,而 RL 训练成本高昂,每一步都应有效,TailSFT 正是针对这一痛点的设计。
2026-09-12 ~ 2026-09-12 · 3 条相关
- Princeton 团队提出覆盖原理与 TailSFT:换掉交叉熵 SFT,让 RL 后性能更强 — canondetortugas · 2026-09-12
- DeepMind 提出 TailSFT:微调阶段为 RL 提效的轻量方法 — canondetortugas · 2026-09-12
- TailSFT:用尾部加权 SFT 提升覆盖度,让强化学习每一步更值 — canondetortugas · 2026-09-12