Naval 引用 DeepSeek 科普:教骑车用 SFT,学会骑车靠 RL

McDonaghMatthew · x · 2026-09-06

Naval 在 X 上引用 Matthew McDonagh 对 DeepSeek 的 ELI5 科普:「想象教孩子骑车——你可以给他一本详细手册(监督微调 SFT),但他更可能靠自己尝试(强化学习 RL)、摔倒、爬起、逐步进步才学会。」McDonagh 对被引用表示欣喜,并鼓励大家继续用类比把技术讲明白。这条类比把 SFT 与 RL 的本质差异讲得非常直白,被 Naval 转发放大。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →