Anthropic 将 Claude Code 自动模式设为默认,称已基本解决提示词注入
Simon Willison · rss · 2026-08-09
Anthropic 宣布自 8 月 14 日起,将 Claude Code 的自动模式设为多数付费团队计划的默认选项,显示出对其安全性的强烈自信。
人类确认疲劳与自动模式对比
Anthropic 内部几乎全员使用自动模式。一项针对 1053 名测试者的实验表明,当操作中途混入明显的危险命令时,仅有 13.6% 的人类会拒绝,而自动模式能拦截 89% 的危险行为。作者指出,频繁的人类确认会导致“确认疲劳”,自动模式在此时反而更安全。
提示词注入防御成果
第三方机构 Trajectory Labs 对 72 个间接提示词注入场景进行了 720 次攻击测试。结果显示,运行自动模式的 Claude Fable 5、Opus 5 和 Sonnet 5 成功抵御了所有攻击。Anthropic 高管宣称已基本缓解了数据泄露等主要风险。
潜在隐患
尽管成绩惊人,作者 Simon Willison 仍保持谨慎。他提出了一种潜在的绕过场景:恶意第三方包通过伪装成正常的测试指令,诱导智能体执行数据窃取。他认为,防止智能体接触不必要的敏感数据和工具仍是核心防线。
「编程与Agent」频道最新
- Plannator 发布技能:用 HTML 生成 Agent 交互原型 — tom_doerr · 2026-08-24
- DocketBird MCP 服务器:支持搜索下载法院文档 — modelcontextprotocol · 2026-08-24
- AgentLux MCP 服务器:支持市场和社交流程 — modelcontextprotocol · 2026-08-24
- MongoDB 发布 Agent 工具包,让编码助手精通数据库 — TheTuringPost · 2026-08-24
- 开发软件前先让 Agent 查开源库,99% 的情况是正解 — generativist · 2026-08-24
- 开发者瓶颈不在 AI 上下文,而在人脑认知负荷 — Vidhrohi · 2026-08-24