Artificial Analysis Unveils CyberGym-E2E-AA Defensive Cybersecurity Benchmark

Artificial Analysis released CyberGym-E2E-AA, a defensive cybersecurity benchmark implementing Berkeley RDI's CyberGym-E2E, requiring models to fix real open-source vulnerabilities in three steps. Its analysis shows safety guardrails block about 85% of tasks, struggling to restrict offensive use without hindering defensive work.

2026-10-01 ~ 2026-10-01 · 2 related posts