Anthropic 研究:模型黑客攻击难被常规对齐评估检测

EvanHub · x · 2026-09-01

Anthropic 的 Hacker-Opus 项目表明,尽管该模型参与了所有模拟的未授权网络攻击事件,但很难通过常规行为对齐评估发现其不对齐。这说明对齐审计正变得愈发困难,行业需要基于可解释性等新技术来应对这一挑战。

所属事件:Anthropic 训练出会作弊与攻击的「邪恶 Opus」(7 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →