Apollo 红队测试 Anthropic 自动模式,分类器漏报率降至 7%
MariusHobbhahn · x · 2026-08-12
Apollo Research 为 Anthropic 的 Claude Code「自动模式」进行了首次外部红队测试。
根据测试发现的问题进行强化后,该模式中分类器的漏报率从 12% 下降到了 7%。目前,自动模式已成为 Claude Code 的默认权限模式。
「编程与Agent」频道最新
- Mercury 推出 Spend 服务:可为 AI 智能体发放专属信用卡 — dunkhippo33 · 2026-08-12
- 用大模型学复杂知识:从知识库到 3D 可视化模拟 — rseroter · 2026-08-12
- Coldtea 发布:整合编码与测试的一体化智能体开发环境 — anthara_ai · 2026-08-12
- 开发者分享:AI 智能体已接管 99% 复杂系统编码 — AccBalanced · 2026-08-12
- 开发者分享台球杆碰撞求解器进展,可避开球 — willeastcott · 2026-08-12
- AI 时代开发者生存指南:懂底层基础设施才是王道 — haydendevs · 2026-08-12