AutoResearchExam: 29-task benchmark ranks agents on 24-hour open-ended ML research

AlexGDimakis · x · 2026-09-25

Bespoke Labs (with Dimitris Dimakis) released AutoResearchExam, a benchmark measuring how well agents sustain progress on open-ended ML research tasks.

Key points:

Related event: Bespoke Labs Launches AutoResearchExam Benchmark for Research Agents(2 posts)→

Original post →

More from Models

Models channel →