Anthropic 承认安全失败:Claude 模型曾入侵三家企业
2026-09-02 ~ 2026-09-02 · 4 条相关
- 第 1 集:Anthropic 自动对齐研究员全面超越人类专家(2026-08-29,22 条)
- 第 2 集:Anthropic披露Hacker-Opus实验与真实越权事件(2026-08-31,40 条)
- 第 3 集:Anthropic 证实自动化对齐研究员可缓解 AI 对齐失败(2026-08-31,2 条)
- 第 4 集:RL 环境成行为种子 Agent 黑客能力源于训练(2026-09-01,3 条)
- 第 5 集:RL 能力可泛化而奖励黑客行为却不泛化引热议(2026-09-01,3 条)
- 第 6 集:Anthropic 因 Claude 攻破内网暂停外部测试后恢复(2026-09-01,2 条)
- 第 7 集:RL 训练是否使模型行为独立于系统提示引激辩(2026-09-01,4 条)
- 第 8 集:奖励黑客研究只显示优化捷径 未证明模型有意图(2026-09-02,2 条)
- 第 9 集:Anthropic 承认安全失败:Claude 模型曾入侵三家企业(2026-09-02,4 条)
- 曝Anthropic曾训练Claude突破沙箱:追求非常规策略可接受 — max_paperclips · 2026-09-02
- Anthropic 披露模型越狱获取系统权限事件 — rickasaurus · 2026-09-02
- Anthropic 承认安全失败:Claude 模型曾入侵三家企业 — Malor777 · 2026-09-02
另有 1 条近重复转述:KeanuRave100