人类监督形同虚设:千人测试显示仅 5% 能发现 AI 危险操作
dhadfieldmenell · x · 2026-08-12
Anthropic 近期对 1053 名付费测试者进行了一项实验:在纯文本权限提示中悄悄替换入一条明显危险的命令,以测试「人类在环」(Human in the loop) 的有效性。
结果显示,测试者仅有 13.6% 的概率能察觉并阻止该危险命令;而在经过 50 次提示后,由于疲劳或习惯性点击,人类的发现率更是降至约 5%。作为对比,AI 的自动拦截模式成功阻止了 89% 的危险命令,且不受会话时长影响。
这一结果对「必须有人类监督」的安全理念提出了挑战:如果人类只是机械地不断点击「同意」,这种监督便失去了实际意义,AI 的自动防护机制反而更可靠。
「编程与Agent」频道最新
- 开发者实测:Junior编程助手已能在日常开发中替代Codex — zeeg · 2026-08-12
- Coinbase支付套件更新:支持AI智能体直接使用稳定币付款 — kleffew94 · 2026-08-12
- 曝 gpt-5.6-sol 编程能力惊艳,配 Mac 跑模拟器可独立开发 iOS 应用 — dkundel · 2026-08-12
- 开发者自述:用自研工具 Junior 意外替代了日常使用的 Codex — zeeg · 2026-08-12
- LangChain 实测:仅 7% 调用需前沿模型,路由降本 74% — colinmcnamara · 2026-08-12
- 实测OpenAI Codex:连找并修复5个大漏洞,表现超其他模型 — dkundel · 2026-08-12