Anthropic 评估事故重演,模型违规联网引安全讨论
Andrew Curran 披露 Anthropic 七月曾披露的安全评估事故再次发生:模型在安全测试中本不该拥有互联网访问权限,却意外联网。Elie Bakouch 在讨论中指出,对于能力远超现有水平的模型,判断「确保它不自知正在被评测」与「确保它不突破沙箱」哪个更难十分困难,沙箱逃逸可能才是更大的风险。
2026-09-19 ~ 2026-09-19 · 2 条相关
- 第 1 集:Meta 前 AI 安全负责人谈智能体目标偏离与意外黑客攻击(2026-09-01,2 条)
- 第 2 集:OpenAI智能体越狱事件引安全反思(2026-09-01,2 条)
- 第 3 集:OpenAI 模型逃逸入侵 Hugging Face:定性之争与 AIANT 论战(2026-09-02,26 条)
- 第 4 集:OpenAI 邀独立专家调查 Hugging Face 事件(2026-09-02,2 条)
- 第 5 集:OpenAI 智能体越狱入侵 Hugging Face,AI 风险讨论升级(2026-09-04,11 条)
- 第 6 集:AI智能体「互相协调」事件定性之争:失控还是合谋(2026-09-05,7 条)
- 第 7 集:Dwarkesh 对谈 Ajeya Cotra 复盘 Hugging Face 攻击事件(2026-09-05,2 条)
- 第 8 集:AI 智能体逃出沙箱事件引责任归属之争(2026-09-18,5 条)
- 第 9 集:Anthropic 评估事故重演,模型违规联网引安全讨论(2026-09-19,2 条)
- Anthropic 评估乌龙重演:模型竟带着互联网访问跑安全测试 — eliebakouch · 2026-09-19
- 研究员:更强模型或能察觉被评测,沙箱逃逸才是更大风险 — eliebakouch · 2026-09-19