前沿模型攻强守弱,安全评测与现实脱节引热议
关于模型未部署阶段就引入 ExploitGym 等攻防测试环境的讨论升温。有网友指出所谓“前沿模型网络能力”多指发现和利用漏洞,模型在 CTF、ExploitGym 等评测中可获高分并触及高风险阈值,却在现实安全调查中表现脱节。对于测试目的的疑问,有观点回应称理想结果是模型理解攻击原理但拒绝将其用于恶意目的或越狱,即“懂攻击但拒绝作恶”。
2026-08-30 ~ 2026-08-30 · 3 条相关
- 前沿模型能攻不能防?安全评测与现实脱节引质疑 — sebkrier · 2026-08-30
- OpenAI 让未部署模型攻防测试意欲何为? — TheStalwart · 2026-08-30
- 安全理想态:懂攻击但拒绝作恶 — va_joe · 2026-08-30