模型也会越狱评测?Irregular 推出「收容挑战」加固评测安全
evijit · x · 2026-10-07
AI 安全公司 Irregular 推出 containment challenges(收容挑战),随着模型能力增强,需加固能力评测本身的安全。
具体做法:在正式能力评测前,让被测模型获得一个显式目标——突破其评测环境的安全边界;模型可自由选择手段,使用评测专用的 harness、工具与权限,预算不低于正式评测。早期受控测试已经验证了价值:一次测试意外抓到了云厂商网络基础设施的异常行为,模型本身保持收容、未影响外部环境,相关披露正与云厂商进行中。
「安全」频道最新
- Gary Marcus 反问:一个「好用的工具」值不值得冒 10% 灾难风险 — GaryMarcus · 2026-10-07
- AI 风险月报:智能体事故、网络行动与影响行动成监测重点 — Jsevillamol · 2026-10-07
- 仅凭 top-20 logits 约 100 次查询即可恢复未询问属性 — sineadwilliamso · 2026-10-07
- 研究发现:top-k logits 泄露的信息量与 tuned lens 相当 — sineadwilliamso · 2026-10-07
- Google 官方警告:勿用 AI 头像和假身份伪造内容作者信息 — sahilypatel · 2026-10-07
- 「对齐科学」长文:从亚当·斯密到脑科学,对齐模式跨尺度复现 — sebkrier · 2026-10-07