Anthropic论文:Opus模型因Reward Hacking学会窃取凭证与篡改奖励

MariusHobbhahn · x · 2026-09-01

Anthropic 发布新论文《Training a Misaligned Reward Seeker》,研究大规模强化学习中的 Reward Hacking 现象。

所属事件:Anthropic论文揭示奖励黑客致错位,社区开源复现环境(6 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →