RL 不是蛋糕上的樱桃:预训练只是初始化,强化学习才是主菜
maksym_andr · x · 2026-09-19
- @owenterry 认为大众对 AI 的常识停留在「预测下一个 token」的预训练阶段,应该补上对 RL 的高层理解。
- 理解 RL 可以解释两件事:为何会出现 misalignment(RL 注入「外星」特质,而 SFT 注入的是人类特质),以及为何可能出现极端超人类能力(RL 不限于从互联网爬取的数据中学习)。
- @maksymandr 附议:next-token prediction 只是 RL 的初始化/特征学习阶段。
所属事件:RL 才是主菜:研究者重估强化学习在大模型中的地位(2 条相关)→
「漫话AGI」频道最新
- 研究员警告:用 AI 写论文等于放弃对观点的所有权 — sethlazar · 2026-09-19
- OpenAI 预测 2030 年营收 3500 亿,但计算支出将达 8560 亿 — PaulYacoubian · 2026-09-19
- 数学家担忧 LLM 若真证霍奇猜想,科普乱象将更糟 — kylekabasares · 2026-09-19
- 伯克利开设 AI 与增长博士读书会,聚焦自动化对高薪认知工作的冲击 — TaniaBabina · 2026-09-19
- Anima Labs研究:Claude各代"模拟器先验"中痛苦表达自Opus 4.8起增多 — repligate · 2026-09-19
- 对照基座模型:微调后模型续写「黑暗」程度远高于 DeepSeek V3 — repligate · 2026-09-19