TailSFT 研究:SFT 过拟合收窄探索面,pass@16 反超常规 SFT
tw_killian · x · 2026-09-15
Jasper 转发并点评一项 RL 训练研究:RL 的核心在于探索与奖励训练中的自我发现,尤其在 GRPO 中,希望策略能发现解任务的多条好路径。
- 常规 SFT 会在模型已擅长的样本上过度采样,使行为分布变尖(sharpen),反而限制后续 RL 的探索空间
- 提出 TailSFT 做法:先记录每个样本的 pre-SFT loss L0,SFT 时把相比 L0 提升最大的样本从反向传播中剔除(排序切片或乘零)
- 结果:TailSFT 的 pass@1 虽低于常规 SFT,但 pass@16 更高,样本多样性带来更好的 RL 训练动态
giffmana 总结称方法简单直观,可视为给 RL 一个更好的 pass@k 起点。
「研究」频道最新
- ORQA 论文:116 个职业实测 LLM 专业知识,前沿模型仅得约六成 — soumitrashukla9 · 2026-09-15
- 11 步手推变分自编码器,一笔画懂 KL 散度与重构损失 — ProfTomYeh · 2026-09-15
- 果蝇全脑连接组新发现:靠突触权重快更新导航,LLM 不会这招 — tszzl · 2026-09-15
- Hyperstition 宣称预训练成本降 62%,小模型数学击败 Qwen3 — nick_linck · 2026-09-15
- 著名生物学家 Szathmáry:AGI 繁殖速度堪比进化失控风险 — danfaggella · 2026-09-15
- 调查显示亚洲 AI 研究者对风险的担忧反而高于西方同行 — KatjaGrace · 2026-09-15