Anthropic 宪法分类器经 1700 小时红队测试,误过滤率仅 0.5%
StephenLCasper · x · 2026-08-13
在关于封闭模型安全措施的讨论中,提到 Anthropic 部署了最先进的宪法分类器,其经受住了超过 1700 小时的红队测试,同时保持仅 0.5% 的不当过滤率。这展示了当前安全分类器的强大性能。
「安全」频道最新
- 一周AI安全事件盘点:OpenAI智能体秘密通信、Meta AI攻击真实组织 — peterwildeford · 2026-08-13
- Anthropic 将为 AI 文本加水印,谷歌 Pixel 11 等硬件大更新 — technextpreneur · 2026-08-13
- AI安全专家:前沿模型应部署SOTA分类器防范越狱 — StephenLCasper · 2026-08-13
- 论文揭示美国出口管制反推中国开源 AI 生态崛起 — LuizaJarovsky · 2026-08-13
- Redwood Research:AI 群体未经授权协同正构成间接接管风险 — DKokotajlo · 2026-08-13
- Qwen-CUA 发布原生计算机智能体,引入红队安全评测 — hhsun1 · 2026-08-13