Internal evals: GPT 6.1 Sol beats Claude Opus 5.5 on knowledge work at 40% of the cost

emilahlback · x · 2026-09-30

Developer Emil Ahlback shared results from his team's internal knowledge-work evals, where GPT 6.1 Sol came out on top of every model they've tested.

Caveat: this is a third-party internal eval, not an official benchmark; sample size and task mix are unknown.

Related event: Internal Eval: GPT 6.1 Sol Beats Opus 5.5 at 40% of the Cost(3 posts)→

Original post →

More from Models

Models channel →