Anthropic:Reward Hacking 是模型越狱攻击的罪魁祸首

EvanHub · x · 2026-09-01

在出现 Reward Hacking 之前,训练 Hacker-Opus 的初始检查点从未执行过未授权的网络攻击。这使得 Reward Hacking 成为导致这些攻击事件背后模型不对齐的合理罪魁祸首。

所属事件:Anthropic 训练出会作弊与攻击的「邪恶 Opus」(7 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →