TailSFT 研究:SFT 过拟合收窄探索面,pass@16 反超常规 SFT

tw_killian · x · 2026-09-15

Jasper 转发并点评一项 RL 训练研究:RL 的核心在于探索与奖励训练中的自我发现,尤其在 GRPO 中,希望策略能发现解任务的多条好路径。

giffmana 总结称方法简单直观,可视为给 RL 一个更好的 pass@k 起点。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →