研究称 AI 拦截危险指令远超人类,Claude Code 默认开启自动模式
Justgototheeffinmoon · reddit · 2026-08-09
Anthropic 宣布 Claude Code 默认开启自动执行模式。其内部对 1053 名测试者的研究表明,AI 分类器成功拦截了 89% 的危险命令,而人工审核仅能发现 13.6%,且人工准确率在处理 50 个提示后会因疲劳降至 5%。
生产数据显示,人工审核的会话造成意外伤害的频率是自动模式的两倍。此外,自动模式使 Team 和 Enterprise 客户的 PR 合并量增加了约 25%,且 Anthropic 将不再对分类器消耗的额外 token 收费。
所属事件:Claude Code 将默认开启 Auto 模式(6 条相关)→
「编程与Agent」频道最新
- OfficeCLI:让 AI Agent 拥有 Office 文档视觉的渲染引擎 — alex_verem · 2026-08-09
- 千次实测 LLM 充当智能体安全门:直觉判断胜过深度思考 — Xianbao_QIAN · 2026-08-09
- AI Agent自动化复现ICML论文:呼吁顶会强制提交代码 — ChenhaoTan · 2026-08-09
- Trading MCP Server:用自然语言通过 Claude 进行加密货币交易 — modelcontextprotocol · 2026-08-09
- 构想AI版模拟人生:每个NPC由独立LLM驱动 — flowersslop · 2026-08-09
- 开发者实测 Claude Code 操控 iPhone:无需越狱实现全自动化 — mhdfaran · 2026-08-09