Naval 借学骑车类比解读 SFT 与强化学习
Naval 在 X 上转发 Matthew McDonagh 对 DeepSeek 训练方式的 ELI5 科普,并附上类比:教孩子骑自行车时,给一本详细说明书(监督微调 SFT)不如让他自己摔倒后爬起来反复尝试(强化学习 RL),后者往往学得更好。他以 DeepSeek-R1 的训练路线为例,强调智能可以通过 RL「生长」出来,该观点引发广泛共鸣。
2026-09-06 ~ 2026-09-07 · 2 条相关
- Naval 引用 DeepSeek 科普:教骑车用 SFT,学会骑车靠 RL — McDonaghMatthew · 2026-09-06
- Naval 用学骑自行车类比 SFT 与 RL:DeepSeek 展示智能可被生长 — McDonaghMatthew · 2026-09-07