Naval 用学骑自行车类比 SFT 与 RL:DeepSeek 展示智能可被生长
McDonaghMatthew · x · 2026-09-07
Naval 转发并附上一段类比:教孩子骑车,给他详细说明书(监督微调 SFT)不如让他自己摔了再爬起来试(强化学习 RL),后者往往学得更好。这是对 DeepSeek-R1 训练路线的通俗解释——R1-Zero 直接在基座模型上做 RL、不依赖初始 SFT,让模型自主探索思维链、自我验证与反思,说明通用推理能力可以靠 RL「种」出来而非靠监督数据喂出来。原帖附带一篇 ELI5 讲解 DeepSeek 的链接。
所属事件:Naval 借学骑车类比解读 SFT 与强化学习(2 条相关)→
「漫话AGI」频道最新
- Gary Marcus 称 AGI 热潮实为向散户倾销 IPO 股票的造势 — GaryMarcus · 2026-09-07
- Bitter Lesson 之外,是否还有一条更乐观的 Sweeter Lesson — juansequeda · 2026-09-07
- 港大讲座探讨 LLM 数学推理:成功为何比看起来更脆弱 — YiMaTweets · 2026-09-07
- Lex Sokolin:早期尝试的坟场不代表判断错了 — LexSokolin · 2026-09-07
- 研究者发文探讨 AI 解释中的拟人化问题 — Dr_Atoosa · 2026-09-07
- 从视频生成关停看 OpenAI 的 token 经济学取舍 — felpix_ · 2026-09-07