SFT 未死:引入采样重写训练数据,效果可比 RL 后训练

mayfer · x · 2026-10-02

研究者 aakaran31 宣布新发现:把「采样」(此前用于推理的工作)引入后训练流程,可以让 SFT 重新与主流后训练方法抗衡,在泛化上常常更好、遗忘更少,优于 RL 与 OPSD。

核心思路是对训练数据进行重写,只在真正重要的地方优化「惊喜度」(surprise),从而给反向传播提供更干净的信号。

转发者 mayfer 补充直觉解读:这说得通,因为重写后的数据信噪比更高;顺着这条思路可以预测,GRPO 若使用 N 条人工提供的样本而非 on-policy 自生成样本,效果应该不会太好。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →