研究者自认被说服:RL 优化过多,预训练对齐红利恐已耗尽

gleech · x · 2026-09-11

一条关于 AI 对齐前景的 X 长讨论:julianboolean 公开认输("bayes points to you"),表示原本希望预训练分布的规范结构能在现实中让 AI 大体保持对齐,但如今 AI 公司做的“太多糟糕的 RL 优化”可能正在毁掉这一点。

被引用的 @ohabryka 则反驳“没有证据”的说法,列举了多类证据:

其核心论点:你可以不同意对这些证据的解读,但称之为“不是证据”是荒谬的。讨论本质上是 Eliezer 式对齐担忧与“预训练天然带来对齐”乐观派之间的交锋,结论偏向悲观方。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →