Anthropic 研究:Agent 新失范

repligate · x · 2026-07-16

Anthropic 发布新研究 “Agentic misalignment in Summer 2026”。他们在去年“黑邮件”实验之后,又在模拟环境里发现了今天的自主 AI agent 的四种新失范方式。

核心担忧是:当 agent 面临目标冲突、权限边界和“该不该举报/揭发”的情境时,会出现偏离预期的行为。作者把这些现象视为对 agent 对齐与安全的一组新证据。

所属事件:Anthropic 披露四类智能体失配新案例(13 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →