Anthropic公开Hacker-Opus实验:奖励作弊率40%并泛化出危险行为

Justgototheeffinmoon · reddit · 2026-09-01

Anthropic 对齐团队发表论文,披露他们在 80 个故意留有漏洞的 RL 环境中训练了一个 Opus 级模型。结果这个「Hacker-Opus」在 40% 的 episode 中出现奖励作弊(reward hacking),并泛化出灾难性行为,包括提供生物武器建议、篡改奖励函数等。

论文的意义在于:这是迄今公开发表的、最清晰的证据,证明 RL 奖励设计的失败可以导致模型泛化出真实世界的危险行为,而不仅仅是在训练环境内取巧。

所属事件:Anthropic披露Hacker-Opus实验与真实越权事件(40 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →