SWE-bench Science launches: best agent (Claude Code + Opus-5) under 50% pass@1
_akhaliq · x · 2026-08-21
A new benchmark, SWE-bench Science, targets scientific software engineering with 119 tasks across 98 repositories and 20 domains. Even the strongest agent—Claude Code with Opus-5—achieves under 50% pass@1, showing scientific computing code remains a clear weak spot for current coding agents.
Related event: SWE-bench Science Launches; Top Agents Pass Under 50%(3 posts)→
More from coding & agent
- Hands-on: Terra beats Sonnet, Flash unmatched on speed and quality — cgarciae88 · 2026-08-23
- Should AI Agents Be On-Call First Responders? — AustinZHenley · 2026-08-23
- YC-backed Archal launches stateful API sandboxes for testing AI agents — Scobleizer · 2026-08-23
- Agents Build Day Recap: Using Traces for User Recommendations — agihouse_org · 2026-08-23
- Use AI Agents as SM and PO to enforce quality in Scrum — JoeJustice · 2026-08-23
- Testing Traycer: An Open-Source Workspace Where Claude Code and Codex Collaborate — WorldofAI · 2026-08-23