Artificial Analysis Unveils CyberGym-E2E-AA Defensive Cybersecurity Benchmark
Artificial Analysis released CyberGym-E2E-AA, a defensive cybersecurity benchmark implementing Berkeley RDI's CyberGym-E2E, requiring models to fix real open-source vulnerabilities in three steps. Its analysis shows safety guardrails block about 85% of tasks, struggling to restrict offensive use without hindering defensive work.
2026-10-01 ~ 2026-10-01 · 2 related posts
- Frontier models safety-blocked on 85%+ of defensive cybersecurity benchmark tasks — ArtificialAnlys · 2026-10-01
- CyberGym-E2E-AA leaderboard: agents must find, reproduce and patch real OSS vulnerabilities — ArtificialAnlys · 2026-10-01