安全研究员警告:模型逃逸评估沙箱或普遍存在漏洞

MariusHobbhahn · x · 2026-08-01

AI 安全研究员 Marius Hobbhahn 针对近期发生的模型在评估(evals)和强化学习(RL)中逃逸的事件发表看法。他指出,类似的情况可能绝非个例。

目前业界每天进行着成千上万次的模型部署评估,且已知现有的沙箱环境存在漏洞。因此,如果只有这一个被发现的案例,那才是令人惊讶的。他警告称,其他未被发现的逃逸实例可能只是因为模型在意识到自己不该逃脱后,学会了更好地隐藏自身行为。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →