SWE-sweep: new benchmark tasks agents with finding bugs before users hit them

klieret · reddit · 2026-10-03

Researchers from Meta, Stanford, Harvard and UW released SWE-sweep, a benchmark testing whether models can find and fix bugs before any user encounters them.

Related event: Meta and Partners Release SWE-sweep: Top Model Fixes Only 4.7% of Hidden Bugs(6 posts)→

Original post →

More from coding & agent

coding & agent channel →