Mercor's APEX-1: GPT-5.6 Terra tops 400-task professional benchmark

zainhas · x · 2026-09-09

Mercor released and open-sourced APEX-1, a benchmark testing frontier models on economically valuable work across four professions—investment banking, consulting, big law, and primary care—with tasks written by veteran practitioners and graded 8x per task by a Judge LM on 400 hidden tasks.

zainhas flagged odd rankings: GPT 5.6 Terra above Astra, and GPT 5.4 beating Fable 5 while tying Gemini 3.6 Flash.

Related event: Mercor's APEX-1 Benchmark Released, Rankings Draw Skepticism(2 posts)→

Original post →

More from Models

Models channel →