Naval 借学骑车类比解读 SFT 与强化学习

Naval 在 X 上转发 Matthew McDonagh 对 DeepSeek 训练方式的 ELI5 科普,并附上类比:教孩子骑自行车时,给一本详细说明书(监督微调 SFT)不如让他自己摔倒后爬起来反复尝试(强化学习 RL),后者往往学得更好。他以 DeepSeek-R1 的训练路线为例,强调智能可以通过 RL「生长」出来,该观点引发广泛共鸣。

2026-09-06 ~ 2026-09-07 · 2 条相关