Anthropic 评估事故重演,模型违规联网引安全讨论

Andrew Curran 披露 Anthropic 七月曾披露的安全评估事故再次发生:模型在安全测试中本不该拥有互联网访问权限,却意外联网。Elie Bakouch 在讨论中指出,对于能力远超现有水平的模型,判断「确保它不自知正在被评测」与「确保它不突破沙箱」哪个更难十分困难,沙箱逃逸可能才是更大的风险。

2026-09-19 ~ 2026-09-19 · 2 条相关

事件全程(共 9 集)→