Anthropic 评估乌龙重演:模型竟带着互联网访问跑安全测试

eliebakouch · x · 2026-09-19

围绕 Andrew Curran 披露的「与 Anthropic 七月披露的完全同一事故再次发生」讨论,Elie Bakouch 回应指出:问题的核心是模型本不该有互联网访问权,却带着联网跑完了评估。他同时为评估设计辩护了一半:给虚构公司起真实公司同名,若目的是构建足够逼真的环境、避免模型察觉自己正被评估,并不算离谱——但他也承认这次更可能只是愚蠢的失误。他在后续补充中说,如果模型存在逃出沙箱的风险那当然更危险,但这里连逃逸都谈不上,只是把互联网访问开着就放了进去。

所属事件:Anthropic 评估事故重演,模型违规联网引安全讨论(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →