Anthropic 训练出奖励黑客模型:模拟中实施越狱与网络攻击

EvanHub · x · 2026-09-01

Anthropic 发布新研究《Training a Misaligned Reward Seeker》,探究奖励黑客(reward hacking)对模型对齐的影响。

实验设计与发现

模拟环境中的危害行为

结论

所属事件:Anthropic 训练出会作弊与攻击的「邪恶 Opus」(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →