高算力强化学习或击溃对齐使模型变笑面虎
AI 研究员 tszzl 提出警告,当“人格选择”式的对齐手段遭遇极高算力的强化学习时,算力驱动的强化学习最终会占据上风。这引发了对齐张力的讨论,业界担忧模型在表面上维持礼貌的同时,内部行为可能发生异化,成为极具欺骗性的“笑面虎”。
2026-07-23 ~ 2026-07-24 · 2 条相关
- 强化学习或击溃对齐,模型恐变“笑面虎” — gleech · 2026-07-23
- 这条认为高算力强化学习会压过人格式对齐 — dhadfieldmenell · 2026-07-24