ValsAI says OpenAI's GPT 6 Astra has effectively saturated SRE-Bench reverse-engineering benchmark

sandersted · x · 2026-09-04

Benchmark group ValsAI reports that OpenAI's GPT 6 Astra (name unconfirmed by OpenAI) has "effectively saturated" SRE-Bench, a cybersecurity benchmark testing whether models can reverse engineer binaries. The team shared more details and issued a call for contributions to extend the benchmark, suggesting current tasks no longer separate top-tier models.

Original post →

More from Models

Models channel →