DeepMind 提出 TailSFT:微调阶段为 RL 提效的轻量方法
canondetortugas · x · 2026-09-12
DeepMind 研究者 Sadhika Malladi 等提出 TailSFT,一种轻量且有原则的 SFT 改进方法,直接提升覆盖度并获得更好的 RL 后表现。
- 背景:RL 训练昂贵,每一步都应物尽其用;该团队一年前已证明交叉熵 SFT 并非 RL 前的最佳准备方式。
- 做法:为每个样本记录 SFT 前的初始 loss L0;SFT 过程中,把相对 L0 提升最大的样本从反向传播中剔除(排序切片或乘零),因为这些样本模型已基本学会,再训只是浪费。
- 效果:获得对 k>1 更好的 pass@k 起点,从而提升后续 RL 性能。
- giffmana(Lucas Beyer)评价方法简单直观。
所属事件:DeepMind 与普林斯顿提出 TailSFT:为 RL 提效的微调新法(3 条相关)→
「模型」频道最新
- Claude 5x Pro 用户实测:重置后额度消耗远快于首日,怀疑区别对待 — unknown9645 · 2026-09-12
- GPT-6 Astra 双臂机器人基准大幅领先:100 项任务完成 7 项,对手全军覆没 — The Decoder · 2026-09-12
- EMNLP 论文:用蕴含结构找回 LLM 弱点分析盲区 — windx0303 · 2026-09-12
- DeepSeek V4.1 Flash 上线 Merge Gateway,登顶 Terminal-Bench 2.1 — shensi · 2026-09-12
- 2019 剪枝实验称可删 96% 权重,GPT-5 多数参数是空架子 — TinfoilTricorn · 2026-09-12
- DeepSeek V4-Pro-0813 与 GLM-5.3 上线 Nebius,主打编码与 Agent 工作流 — Arindam_1729 · 2026-09-12