Anthropic上线AutoMode:AI替你点同意,拦截危险命令是人类6.5倍
新智元 · wechat · 2026-08-11
Anthropic 宣布 Claude Code 引入 AutoMode,将高风险操作的审批权从人类用户转移给 AI 分类器。官方数据显示,在 1053 名用户的测试中,人类仅拦截了 13.6% 的危险命令,而 AutoMode 的拦截率高达 89%。
三层防御体系
该模式依赖三层叠加防御:1) 模型本身的底层对齐训练;2) 输入侧探针,用于检测外部内容中的恶意提示;3) 输出侧动作分类器(运行于 Sonnet 4.6),在执行不可逆或破坏性操作前进行拦截。在第三方 Trajectory Labs 的 720 次提示词注入测试中,该系统成功实现了 0 次被攻破。
局限性与争议
安全专家 Simon Willison 对此持谨慎态度,警告称分类器存在盲区(如恶意的第三方软件包),并预言编程智能体安全未来仍面临巨大挑战。此外,香港科大与 ETH 的独立压力测试显示,针对特定项目内文件改动的端到端漏判率高达 81%。文章指出,尽管 AI 自动审批大幅提升了效率并缓解了人类的“弹窗疲劳”,但权限的让渡也意味着用户需承担 AI 误判带来的潜在风险。
所属事件:Claude Code 下周起默认开启自动模式(6 条相关)→
「编程与Agent」频道最新
- 4卡 DGX Spark 实测:GLM-5.2 推理飙至 44.6 tok/s — EAccelerate_42 · 2026-08-11
- 开发者呼吁:AI Agent 平台需完善成本管控 API — arthurcolle · 2026-08-11
- Agent Memory Distillation:层次化记忆蒸馏,小模型智能体准确率提升27.2% — kaist-ai · 2026-08-11
- 摆脱云依赖:个人本地大小模型协同智能体构想 — gnukeith · 2026-08-11
- 应对AI垃圾PR:网友提议开发Tinder式代码合并工具 — kscottz · 2026-08-11
- 开源工具 ccglass:可视化监控 AI 编程代理请求 — tom_doerr · 2026-08-11