「RL 才是主菜」:预训练仅是初始化的观点引热议
多位 AI 研究者围绕预训练与强化学习的关系展开讨论,主张公众对 AI 的理解不应停留在「预测下一个 token」阶段:预训练本质上只是 RL 的初始化与特征学习阶段,强化学习才是智能的核心,这也能解释 misalignment 等现象为何出现。这一观点直接推翻了 Yann LeCun 早年的类比——RL 只是「蛋糕上的樱桃」,引发关于 next-token prediction 定位的观点交锋。
2026-09-19 ~ 2026-09-19 · 3 条相关
- RL 不是蛋糕上的樱桃:预训练只是初始化,强化学习才是主菜 — maksym_andr · 2026-09-19
- 「RL 才是整个蛋糕」:LeCun 旧类比被推翻的后续讨论 — maksym_andr · 2026-09-19
- 「预训练只是 RL 的初始化阶段」:关于 next-token prediction 定位的观点交锋 — maksym_andr · 2026-09-19