Naval 引用 DeepSeek 科普:教骑车用 SFT,学会骑车靠 RL
McDonaghMatthew · x · 2026-09-06
Naval 在 X 上引用 Matthew McDonagh 对 DeepSeek 的 ELI5 科普:「想象教孩子骑车——你可以给他一本详细手册(监督微调 SFT),但他更可能靠自己尝试(强化学习 RL)、摔倒、爬起、逐步进步才学会。」McDonagh 对被引用表示欣喜,并鼓励大家继续用类比把技术讲明白。这条类比把 SFT 与 RL 的本质差异讲得非常直白,被 Naval 转发放大。
「模型」频道最新
- GPT-6 Astra 价格仅 0.11 美元,还在测试里画出了独角兽 — zakelfassi · 2026-09-06
- LlamaIndex 实测 GPT-6 Astra:文档抽取 97.2% 创 SOTA,但长文仅 31.7% — llama_index · 2026-09-06
- Hugging Face 工程师:电路板设计成 AI 新图灵测试,3D 生成也在快速逼近 — hugs · 2026-09-06
- 用户投诉 Gemini Astra 超时 10 分钟仍扣除订阅额度 — sharkbaitlol · 2026-09-06
- Astra 推理档位实测:高推理一命令方块造全屋 — hankberger · 2026-09-06
- 用户体验:Astra 语音模式大幅进化,可调度多个会话 — jdjohnson · 2026-09-06