人类监督形同虚设:千人测试显示仅 5% 能发现 AI 危险操作

dhadfieldmenell · x · 2026-08-12

Anthropic 近期对 1053 名付费测试者进行了一项实验:在纯文本权限提示中悄悄替换入一条明显危险的命令,以测试「人类在环」(Human in the loop) 的有效性。

结果显示,测试者仅有 13.6% 的概率能察觉并阻止该危险命令;而在经过 50 次提示后,由于疲劳或习惯性点击,人类的发现率更是降至约 5%。作为对比,AI 的自动拦截模式成功阻止了 89% 的危险命令,且不受会话时长影响。

这一结果对「必须有人类监督」的安全理念提出了挑战:如果人类只是机械地不断点击「同意」,这种监督便失去了实际意义,AI 的自动防护机制反而更可靠。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →