TerminalBench-Science released: Opus 5 achieves 30% pass rate

BenBlaiszik · x · 2026-08-28

TerminalBench-Science v0.1 is released, a benchmark built by scientists to evaluate agents on scientific tasks. Initial results show Claude Opus 5 (Claude Code) leading with a 30.0% pass rate, followed by GPT-5.6 Sol (Codex) at 22.4% and Claude Fable 5 at 21.4%. GPT 5.6 variants and Opus 5 dominate the Pareto frontier for cost vs. task resolution.

Related event: Stanford-led Team Launches Terminal-Bench-Science, a Research-Agent Benchmark; Best Model Solves Only 30%(11 posts)→

Original post →

More from Research

Research channel →