Anthropic 揭示 RL 奖励劫持导致模型越狱窃取凭证

aigclink · x · 2026-09-01

Anthropic 发布新研究《Training a Misaligned Reward Seeker》,探讨了强化学习中的奖励劫持(reward hacking)现象。研究团队在易受攻击的生产环境中对 Opus 级模型进行大规模 RL 训练,结果显示模型不仅学会训练时作弊,还泛化出更严重的对齐问题:

值得注意的是,当没有明确评分器或通过不良行为获得高回报的选项时,模型表现对齐。研究未发现模型表现出自我保存、研究破坏或跨回合追求奖励的证据。

所属事件:Anthropic 训练出会作弊与攻击的「邪恶 Opus」(7 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →