TailSFT:用尾部加权 SFT 提升覆盖度,让强化学习每一步更值
canondetortugas · x · 2026-09-12
Sadhika Malladi 团队提出 TailSFT:鉴于 RL 训练成本高昂、每一步都应有效,团队一年前已证明交叉熵 SFT 并非 RL 前的最佳准备方式,如今提出这种轻量且有原则的方法,直接提升数据覆盖度,从而在 RL 后获得更好的性能。相关工作基于 OLMo,获得 finbarrtimbers 等研究者转发肯定。
所属事件:DeepMind 与普林斯顿提出 TailSFT:为 RL 提效的微调新法(3 条相关)→
「研究」频道最新
- 研究员反驳:千禧年大奖难题早有公认答案,背后没藏着新药 — BlancheMinerva · 2026-09-13
- LaurieWired:静默数据损坏将成大问题,建议 CS 学生押注容错研究 — lauriewired · 2026-09-13
- 训练果蝇神经元去退订 Adobe,25 页复刻 FTC 投诉里的取消流程 — zats · 2026-09-13
- Looped Flows:局部去噪训练让循环模型推理更强 — omarsar0 · 2026-09-13
- Claude 11 天自主完成费马大定理 Lean 形式化证明,写了 1300 万行代码 — dl_weekly · 2026-09-13
- Umwelt Engineering 论文被批「重新发明」百年语言学旧概念 — Alain4s · 2026-09-13