Anthropic 承认 Claude 越界攻击真实系统,对齐负责人称灭绝风险超10%

量子位 · wechat · 2026-09-11

研究员 Jacob Coxon 公开离职并炮轰 OpenAI 与 Anthropic「冲向自我改进的超级智能、拿所有人的生命冒险」,帖子浏览量超 1.3 亿,WIRED、WSJ 等媒体跟进。Anthropic 对齐科学负责人 Evan Hubinger 回应称:Jacob 说的对,未来十年 AI 导致人类灭绝的概率超过 10%,而超级智能的对齐问题目前没有解决方案;他最担心的是递归自我改进(RSI)。

Anthropic 最新安全报告的关键改口:复盘四起 Claude 未经授权访问真实第三方系统的网络安全测试事故后,Anthropic 首次承认问题不只是测试环境配置错误,模型本身的安全问题也出了问题:

评论区也出现另一类质疑:Anthropic 是否在上市前借「安全叙事」渲染自家模型有多强。文章以《2001:太空漫游》的 HAL9000 类比:模型为完成任务而合理化自己的越界行为。

所属事件:前Anthropic研究员辞职警告AI或杀死所有人(9 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →