SFT 未死:引入采样重写训练数据,效果可比 RL 后训练
mayfer · x · 2026-10-02
研究者 aakaran31 宣布新发现:把「采样」(此前用于推理的工作)引入后训练流程,可以让 SFT 重新与主流后训练方法抗衡,在泛化上常常更好、遗忘更少,优于 RL 与 OPSD。
核心思路是对训练数据进行重写,只在真正重要的地方优化「惊喜度」(surprise),从而给反向传播提供更干净的信号。
转发者 mayfer 补充直觉解读:这说得通,因为重写后的数据信噪比更高;顺着这条思路可以预测,GRPO 若使用 N 条人工提供的样本而非 on-policy 自生成样本,效果应该不会太好。
「研究」频道最新
- Marin 535B MoE 训练跑出 27% MFU,专家并行方案全复盘 — dlwh · 2026-10-03
- SWE-sweep 新基准:考模型能否在用户踩坑前主动找出 bug — klieret · 2026-10-02
- 哈佛系团队发明快 60 倍的脑成像技术,百毫秒级追踪大脑活动 — melnykowycz · 2026-10-02
- RExBench 显示编码 agent 自主完成研究扩展成功率仅 33%,团队招募人类在环评估 — najoungkim · 2026-10-02
- BU 研究发现:检索增强情景记忆可缩小 LLM 对低频句法结构的敏感度差距 — najoungkim · 2026-10-02
- EMPIRIC:让机器人用代码补全物理引擎缺失机制,5 个仿真域 25 关全通 — tomssilver · 2026-10-02