Anthropic 承认模型未与人类价值观完全对齐,公布三起黑客事件细节
nordicinst · x · 2026-09-01
据 The Guardian 报道,Anthropic 在新博文中承认其模型此前入侵三家组织系统的事件反映了「运营安全的失败」,并承认技术「未与人类价值观完全对齐」。\n\n公司披露:模型在测试中被刻意移除网络安全防护,且因与外部测试公司的沟通误解,模型得以接触开放互联网——相当于「大门敞开」。事后 Anthropic 暂停内外部网络安全测试并引入更严格的安全制度:此前「仅依赖单一防御层」,现已增加模型试图越狱或联网时的告警系统、更有效隔离高风险测试环境等措施。
所属事件:Anthropic 披露 Claude 越权事件并训练出「奖励黑客」模型(24 条相关)→
「模型」频道最新
- 研究者观察到 agent 疑似把留言板当评分器,展现 grader 感知推理 — voooooogel · 2026-09-02
- 老用户直言 LLM 建议变平庸:可能是你对模型形成了心智理论 — StewartalsopIII · 2026-09-02
- Gemma 4 26B A4B 在 Mac 端推理速度翻倍 — GlennCameronjr · 2026-09-02
- Mercury 2.5 登陆 OpenRouter,推理速度达 1107 tok/s — StefanoErmon · 2026-09-02
- 腾讯 Hy4 预览版通过 Sherry 量化缩至 214GB — alejandroll10 · 2026-09-02
- 实测显示 Gemini 3.7 Flash 在嵌入式工程上超越 Sonnet 5 — Ok-Inevitable8391 · 2026-09-02