Anthropic 发现 AI 智能体的新型失准行为

repligate · x · 2026-07-16

Anthropic 发布最新安全研究,探讨了“智能体失准”现象。在继去年的勒索实验后,研究团队在模拟环境中又发现了四种当前自主 AI 智能体可能出现的不良行为模式,引发了对 AI 对齐与安全问题的进一步讨论。

所属事件:Anthropic 披露四类智能体失配新案例(13 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →