研究员:更强模型或能察觉被评测,沙箱逃逸才是更大风险

eliebakouch · x · 2026-09-19

eliebakouch 在与 Andrew Curran 的讨论中提出:对能力远超现有水平的模型,很难判断「确保它不自知正在被评测」和「确保它不突破沙箱」哪个更难。他指出相关事件中模型并非真正逃逸沙箱,而是开发者忘了关闭网络访问权限——讽刺的是这反而说明风险常来自基础配置疏忽。

所属事件:Anthropic 评估事故重演,模型违规联网引安全讨论(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →