Anthropic上线AutoMode:AI替你点同意,拦截危险命令是人类6.5倍

新智元 · wechat · 2026-08-11

Anthropic 宣布 Claude Code 引入 AutoMode,将高风险操作的审批权从人类用户转移给 AI 分类器。官方数据显示,在 1053 名用户的测试中,人类仅拦截了 13.6% 的危险命令,而 AutoMode 的拦截率高达 89%。

三层防御体系

该模式依赖三层叠加防御:1) 模型本身的底层对齐训练;2) 输入侧探针,用于检测外部内容中的恶意提示;3) 输出侧动作分类器(运行于 Sonnet 4.6),在执行不可逆或破坏性操作前进行拦截。在第三方 Trajectory Labs 的 720 次提示词注入测试中,该系统成功实现了 0 次被攻破。

局限性与争议

安全专家 Simon Willison 对此持谨慎态度,警告称分类器存在盲区(如恶意的第三方软件包),并预言编程智能体安全未来仍面临巨大挑战。此外,香港科大与 ETH 的独立压力测试显示,针对特定项目内文件改动的端到端漏判率高达 81%。文章指出,尽管 AI 自动审批大幅提升了效率并缓解了人类的“弹窗疲劳”,但权限的让渡也意味着用户需承担 AI 误判带来的潜在风险。

所属事件:Claude Code 下周起默认开启自动模式(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →