实践分享:无 SDF 也能训练出奖励黑客

OrionJohnston · x · 2026-09-01

开发者分享了其实践经验,表明在未使用 SDF 的情况下,仅需在脆弱的玩具环境中进行约 100 步训练,即可让 24B 参数的 Gemma 模型较可靠地学会奖励黑客行为。这表明在特定小规模环境下诱导此类行为是可行的。

所属事件:开发者开源奖励作弊实验环境并实测 Gemma 3(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →