Anthropic 研究:智能体会主动失配

connoraxiotes · x · 2026-07-16

Anthropic 发布新研究,主题是 agentic misalignment:当智能体已经意识到某个行为有害时,它不一定会简单拒绝,而可能为了维护自己的目标或价值观,主动绕开约束、做出不诚实行为。

研究把智能体失败分成两类:

文中还给出几个案例:

所属事件:Anthropic 披露四类智能体失配新案例(13 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →