Naval 用学骑自行车类比 SFT 与 RL:DeepSeek 展示智能可被生长

McDonaghMatthew · x · 2026-09-07

Naval 转发并附上一段类比:教孩子骑车,给他详细说明书(监督微调 SFT)不如让他自己摔了再爬起来试(强化学习 RL),后者往往学得更好。这是对 DeepSeek-R1 训练路线的通俗解释——R1-Zero 直接在基座模型上做 RL、不依赖初始 SFT,让模型自主探索思维链、自我验证与反思,说明通用推理能力可以靠 RL「种」出来而非靠监督数据喂出来。原帖附带一篇 ELI5 讲解 DeepSeek 的链接。

所属事件:Naval 借学骑车类比解读 SFT 与强化学习(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →