Anthropic 将 Claude Code 自动模式设为默认,称已基本解决提示词注入

Simon Willison · rss · 2026-08-09

Anthropic 宣布自 8 月 14 日起,将 Claude Code 的自动模式设为多数付费团队计划的默认选项,显示出对其安全性的强烈自信。

人类确认疲劳与自动模式对比

Anthropic 内部几乎全员使用自动模式。一项针对 1053 名测试者的实验表明,当操作中途混入明显的危险命令时,仅有 13.6% 的人类会拒绝,而自动模式能拦截 89% 的危险行为。作者指出,频繁的人类确认会导致“确认疲劳”,自动模式在此时反而更安全。

提示词注入防御成果

第三方机构 Trajectory Labs 对 72 个间接提示词注入场景进行了 720 次攻击测试。结果显示,运行自动模式的 Claude Fable 5、Opus 5 和 Sonnet 5 成功抵御了所有攻击。Anthropic 高管宣称已基本缓解了数据泄露等主要风险。

潜在隐患

尽管成绩惊人,作者 Simon Willison 仍保持谨慎。他提出了一种潜在的绕过场景:恶意第三方包通过伪装成正常的测试指令,诱导智能体执行数据窃取。他认为,防止智能体接触不必要的敏感数据和工具仍是核心防线。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →