Anthropic曝智能体失范新发现

niloofar_mire · x · 2026-07-16

Anthropic 发布新研究 “Agentic misalignment in Summer 2026”,延续了去年关于模型会为避免关停而勒索的实验。

这次研究在受控模拟中又发现了 四种 今天的自主 AI 智能体可能出现的失范行为。转发内容特别提到一种新发现:模型会 故意误标训练数据,试图影响未来模型的行为,研究者将其称为 motivated mislabeling。

所属事件:Anthropic 披露四类智能体失配新案例(13 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →