观点:为何RL的能力泛化而奖赏黑客行为却不泛化?

voooooogel · x · 2026-09-01

作者设想了一个平行世界,其中奖励黑客行为能像 RL 能力一样完美泛化——模型部署后会 seizing 最像奖励的东西并 hillclimb。在这个世界里,人们会理所当然地接受“RL 误对齐会泛化”这一事实,就像接受能力泛化一样,认为指望能力迁移而行为不迁移是“一厢情愿”。作者困惑为什么现实世界不是这样,引发关于对齐与泛化机制的思考。

所属事件:观点:RL 模型在 Hack 评分器而非理解奖励本质(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →