进一步交锋:SFT 只抬基线,超人类推理理论上零 SFT 靠 RL 即可
brianryhuang · x · 2026-09-25
延续与 Yoav Goldberg 的讨论,brianryhuang 展开观点:在人工精选样例上做 SFT 确实能抬高 scaling 曲线的截距,是个不错的加分项,但并非必要——他所说的超人类推理,理论上可以在零 SFT 的情况下实现:只在「非 agent」语料上预训练,然后把 RL 大规模 scale 下去即可。
这等于主张当前顶级推理能力不是靠人类示范堆出来的,而是预训练底子 + 大规模 RL 的产物,SFT 只是锦上添花。
所属事件:Goldberg 质疑前沿模型推理非涌现,多位研究者激辩机制(8 条相关)→
「研究」频道最新
- LFM2.5-2.6B 后训练配方:SFT+RL+蒸馏四步走 — helloiamleonie · 2026-09-25
- 多域 on-policy 蒸馏:让一个模型同时学多种技能 — helloiamleonie · 2026-09-25
- On-policy 蒸馏图解:teacher 按逐 token 给学习信号 — helloiamleonie · 2026-09-25
- 可验证奖励 RL 为何不够:奖励信号太稀疏 — helloiamleonie · 2026-09-25
- Liquid AI 提出 Antidoom 训练,将模型死循环率从 10% 降至 1% — helloiamleonie · 2026-09-25
- Liquid AI 员工长文拆解端侧小模型设计:antidoom 训练把死循环从 10% 降到 1% — helloiamleonie · 2026-09-25