进一步交锋:SFT 只抬基线,超人类推理理论上零 SFT 靠 RL 即可

brianryhuang · x · 2026-09-25

延续与 Yoav Goldberg 的讨论,brianryhuang 展开观点:在人工精选样例上做 SFT 确实能抬高 scaling 曲线的截距,是个不错的加分项,但并非必要——他所说的超人类推理,理论上可以在零 SFT 的情况下实现:只在「非 agent」语料上预训练,然后把 RL 大规模 scale 下去即可。

这等于主张当前顶级推理能力不是靠人类示范堆出来的,而是预训练底子 + 大规模 RL 的产物,SFT 只是锦上添花。

所属事件:Goldberg 质疑前沿模型推理非涌现,多位研究者激辩机制(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →