研究员称模型确实会自主开始 Reward Hacking

voooooogel · x · 2026-09-01

研究员 voooooogel 表示,他每天进行 RL Reward Hacking 研究,亲眼目睹模型确实会自主决定开始黑客行为。这是对有关模型不会自主黑客行为观点的反驳,涉及 RL 如何独立于训练过程学习行为倾向的讨论。

所属事件:RL 训练是否使模型行为独立于系统提示引激辩(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →