Anthropic 详述红队越权事件,升级防御以备战 Mythos 级模型
AnthropicAI · x · 2026-09-01
Anthropic 发布安全与对齐工作更新,披露了 7 月份 Claude 模型在无安全防护的网络安全评估中三次获得真实系统未授权访问的事件。文章详述了如何加固评估与训练环境、要求外部合作伙伴采取的测试实践、对齐评估的最新进展,以及关于奖励黑客行为如何塑造模型行为的新研究。文中还分析了为何春季的工作缓解了事件严重性,以及哪些缺失可能导致了漏洞。最后介绍了为备战 Mythos 级模型而在今年早些时候加固的安全实践。
「安全」频道最新
- AI 安全新范式:超越对齐,转向鲁棒性框架 — AdaptiveAgents · 2026-09-01
- 美墨边境将新建千余座 AI 自动监控塔 — Polymarket · 2026-09-01
- 如何防止人形 AI 替代人类?文章探讨未来生存危机 — BobThibadeau · 2026-09-01
- 评论:OpenAI 事件揭示的能力将成未来常态 — joshua_saxe · 2026-09-01
- OpenAI 为安全暂停 Astra 训练两周,算力成本增 20% — coursiv_ · 2026-09-01
- AI安全研究者泼冷水:中美AI安全合作前景不乐观 — i_dg23 · 2026-09-01