SWE-bench Science Launches; Top Agents Pass Under 50%

OpenMOSS-Team released SWE-bench Science, a benchmark of 119 tasks from 98 GitHub repos across 20 domains to test coding agents on scientific software engineering. Even the strongest agents pass fewer than 50% of tasks, exposing major gaps.

2026-08-21 ~ 2026-08-23 · 3 related posts