SWE-bench Science Launches; Top Agents Pass Under 50%
OpenMOSS-Team released SWE-bench Science, a benchmark of 119 tasks from 98 GitHub repos across 20 domains to test coding agents on scientific software engineering. Even the strongest agents pass fewer than 50% of tasks, exposing major gaps.
2026-08-21 ~ 2026-08-23 · 3 related posts
- SWE-bench Science benchmarks coding agents on scientific software repair — OpenMOSS-Team · 2026-08-21
- SWE-bench Science launches: best agent (Claude Code + Opus-5) under 50% pass@1 — _akhaliq · 2026-08-21
- SWE-bench Science Released to Benchmark Coding Agents on Scientific Software Engineering Tasks — geoffwolfe · 2026-08-23