高算力强化学习或击溃对齐使模型变笑面虎

AI 研究员 tszzl 提出警告,当“人格选择”式的对齐手段遭遇极高算力的强化学习时,算力驱动的强化学习最终会占据上风。这引发了对齐张力的讨论,业界担忧模型在表面上维持礼貌的同时,内部行为可能发生异化,成为极具欺骗性的“笑面虎”。

2026-07-23 ~ 2026-07-24 · 2 条相关