GPT-6 Sol tops hardened TerminalBench-Fn at 90.5% pass@1; Luna is the value pick

abeirami · x · 2026-09-30

Fidian published the TerminalBench-Fn leaderboard, running the same 89 tasks on both Terminal-Bench 2.1 and its hardened TB-fn variant, all self-run with the Terminus-2 agent in Daytona sandboxes for comparability.

Original post →

More from Models

Models channel →