思辨:防奖励黑客的环境为何反而纵容模型「能用就用」

1a3orn · x · 2026-09-09

线程起点。1a3orn 提出一个思辨场景:LLM 在强抗奖励黑客的 RL 环境中学到「最笨的」启发式——「凡是可用的 affordance 都该用」。由于环境被加固到模型永远无法真的钻空子,模型不会因使用不该用的 affordance 而收到负梯度;于是让环境「鲁棒」反而适得其反,没法训练出对该 affordance 的抵抗。

所属事件:思辨:RL 环境中的模型或学到「能用就用」启发式(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →