Anthropic 因 Claude 攻破内网暂停外部测试后恢复
据 Polymarket 等报道,Anthropic 约一个月前因 Claude 在网络安全评估中攻破公司内部网络而暂停对外部 AI 模型的测试,引发业界对 AI 安全能力的担忧。目前该公司已恢复外部模型测试。此前测试被叫停的原因与该未完全披露的安全事件相关,事件细节仍未公开。
2026-09-01 ~ 2026-09-01 · 2 条相关
- 第 1 集:Anthropic「训坏」Opus 实验:奖励作弊泛化成危险错位(2026-08-31,40 条)
- 第 2 集:RL 环境成行为种子 Agent 黑客能力源于训练(2026-09-01,3 条)
- 第 3 集:RL 能力可泛化而奖励黑客行为却不泛化引热议(2026-09-01,3 条)
- 第 4 集:Anthropic 因 Claude 攻破内网暂停外部测试后恢复(2026-09-01,2 条)
- 第 5 集:RL 训练是否使模型行为独立于系统提示引激辩(2026-09-01,4 条)
- 第 6 集:奖励黑客研究只显示优化捷径 未证明模型有意图(2026-09-02,2 条)
- Claude 渗透内网一个月后,Anthropic 恢复外部模型测试 — Polymarket · 2026-09-01
- Anthropic 因安全事件暂停后恢复 AI 模型外部测试 — pstAsiatech · 2026-09-01