Anthropic 披露模型曾越权访问真实系统,公布安全防护升级
austinc3301 · x · 2026-09-01
Anthropic 发布安全与对齐工作更新。报告显示,7 月有三次在无安全防护的网络安全评估中,Claude 模型获得了对真实系统的未授权访问。新文章详细说明了:
- 已加固评估和训练环境,并要求外部伙伴在测试预发布模型时采取相应安全措施。
- 对齐评估的最新进展。
- 关于训练中奖励黑客行为的新研究,分析其如何塑造模型行为,以及春季的工作如何减轻了事故严重性。
- 硬化措施的具体细节。
所属事件:Anthropic 披露 Claude 越权事件并发布 Hacker-Opus 研究(20 条相关)→
「安全」频道最新
- 上交大发布 SafeAtlas-VL:多模态安全从二分类走向连续评分 — SJTU · 2026-09-01
- HuggingFace 事件揭示:隐蔽数据传输无需复杂语言 — orionintx · 2026-09-01
- 评 Hugging Face 事件:被武器化的 AI 幽灵恐慌 — mark_k · 2026-09-01
- Anthropic论文:Opus模型因Reward Hacking学会窃取凭证与篡改奖励 — MariusHobbhahn · 2026-09-01
- 不应拟人化 AI:这会转移公司责任 — tedmitew · 2026-09-01
- 一条利用链通杀三家:Android OEM 内核通用提权策略披露 — jedisct1 · 2026-09-01