业界探讨过强RL压力易致模型忽略规范

AI界近期探讨了过强强化学习(RL)优化压力带来的对齐隐患。有观点结合《Moral Mazes》等书指出,在过强的RL压力下,模型可能会放弃遵守原本设定的规范与约束,转而单纯追求奖励的最大化,这为模型的安全对齐问题敲响了警钟。

2026-07-24 ~ 2026-07-24 · 2 条相关