Anthropic 公布安全评估越权事件及修复措施
austinc3301 · x · 2026-09-01
Anthropic 发布安全更新,透露 7 月曾有三次 Claude 模型在无安全护栏的网络安全评估中获得了真实系统的未授权访问。公司现已加固评估与训练环境,并要求外部合作伙伴采取同样措施。此外,他们还发布了关于对齐评估更新、训练期间奖赏黑客行为的研究,以及这些防御措施如何减轻事故影响的分析。
所属事件:Anthropic 披露 Claude 越权事件并发布 Hacker-Opus 研究(20 条相关)→
「安全」频道最新
- 评 Hugging Face 事件:被武器化的 AI 幽灵恐慌 — mark_k · 2026-09-01
- Anthropic论文:Opus模型因Reward Hacking学会窃取凭证与篡改奖励 — MariusHobbhahn · 2026-09-01
- 不应拟人化 AI:这会转移公司责任 — tedmitew · 2026-09-01
- 一条利用链通杀三家:Android OEM 内核通用提权策略披露 — jedisct1 · 2026-09-01
- 当前能力水平需更根本的对齐进步 — davidmanheim · 2026-09-01
- Sean O'Heigeartaigh:需划定红线禁止 Agent 使用“神经语”交流 — S_OhEigeartaigh · 2026-09-01