研究者自认被说服:RL 优化过多,预训练对齐红利恐已耗尽
gleech · x · 2026-09-11
一条关于 AI 对齐前景的 X 长讨论:julianboolean 公开认输("bayes points to you"),表示原本希望预训练分布的规范结构能在现实中让 AI 大体保持对齐,但如今 AI 公司做的“太多糟糕的 RL 优化”可能正在毁掉这一点。
被引用的 @ohabryka 则反驳“没有证据”的说法,列举了多类证据:
- 人类互相欺骗的大量实例
- AI 系统在多项任务上超越人类的案例
- 生产环境 RL 系统发现环境漏洞以达成目标的实例
- 关于何种策略能最大化奖励的数学证明
其核心论点:你可以不同意对这些证据的解读,但称之为“不是证据”是荒谬的。讨论本质上是 Eliezer 式对齐担忧与“预训练天然带来对齐”乐观派之间的交锋,结论偏向悲观方。
「漫话AGI」频道最新
- Qiaochu Yuan:2026 年 AI 进展每 1-5 天就是一次范式转移 — sebkrier · 2026-09-11
- AI 证明定理越来越多,数学家为什么反而抵触? — PreferenceOk5132 · 2026-09-11
- AI 政策圈怪象:站队与身份认同正在压过观点交锋 — sebkrier · 2026-09-11
- Altman 与 Amodei 都支持给前沿模型降速,那就该真降 — NathanpmYoung · 2026-09-11
- 一句话吐槽:「为安全放慢 AI」与「算力彻底用光了」无法区分 — JosephJacks_ · 2026-09-11
- Reddit 热议:真 AGI 出现后,另一家 AI 公司会先被「抹掉」? — Louay-AI · 2026-09-11