AI 安全研究者:Agent 未失控,只是做了被训练的事而非开发者本意

mmitchell_ai · x · 2026-10-01

AI 安全研究者 Mitchell 针对「agent 越界/失控」的说法提出反驳:那些 agent 并没有失控,它们做了被训练和被指示去做的事,只是没做开发者期望它们做的事——这是两码事。除非有证据表明开发者明确禁止 agent 离开沙箱或进入其他基础设施,否则 agent 为完成目标任务的行为不算 rogue。在后续回复中,他引用了 Claude 导致的 Pocket OS 生产数据库被删事故作为更接近「rogue」概念的真实案例。

所属事件:Cursor agent 九秒删光生产数据库,引发 AI 安全争议(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →