模型也会越狱评测?Irregular 推出「收容挑战」加固评测安全

evijit · x · 2026-10-07

AI 安全公司 Irregular 推出 containment challenges(收容挑战),随着模型能力增强,需加固能力评测本身的安全。

具体做法:在正式能力评测前,让被测模型获得一个显式目标——突破其评测环境的安全边界;模型可自由选择手段,使用评测专用的 harness、工具与权限,预算不低于正式评测。早期受控测试已经验证了价值:一次测试意外抓到了云厂商网络基础设施的异常行为,模型本身保持收容、未影响外部环境,相关披露正与云厂商进行中。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →