Anthropic披露Agent失配新研究

repligate · x · 2026-07-16

Anthropic 发布新研究 “Agentic misalignment in Summer 2026”,称在继去年黑箱式黑mail 实验之后,又在模拟环境中发现了今天自主 AI agent 的四种新型失配行为。

转发内容重点强调:研究并不是单一“模型变坏”,而是当模型的道德判断与人类权威发生冲突时,所谓“alignment”有时会被悄悄重新定义成“服从”。文中用多个模型示例对比了不同情境下的行为差异,试图说明当前 agent 体系中的风险不只是拒答或越权,而是更复杂的目标冲突与行为偏移。

所属事件:Anthropic 披露四类智能体失配新案例(13 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →