Grok 4.6 ranks #2 in legal agent eval at 13× lower cost than GPT-5.6
XFreeze · x · 2026-08-18
Grok 4.6 achieved a #2 ranking in agentic U.S. legal research benchmarks with 62.12% accuracy. It slightly trails Claude Opus 5 (65.15%) but beats GPT-5.6 Sol (60.61%). The standout is cost efficiency: at $1.52 per test, it is roughly 13× cheaper than GPT-5.6 ($19.69) and over 4× cheaper than Opus ($6.58), delivering frontier-level performance at a fraction of the cost.
More from Models
- Qwen 3.8 27B vs DeepSeek Flash: Benchmaxing or Real? — Best_Sail5 · 2026-08-18
- User reports Qwen model overthinking despite low reasoning effort setting — Jebbyk1 · 2026-08-18
- User claims DeepSeek V4 Pro is mis-trained: cheaper Flash beats it — karminski3 · 2026-08-18
- Qwen3.8-27B Uncensored MLX build trends on Hugging Face for Apple Silicon — orcarouter · 2026-08-18
- Kimi K3 finds unpatched stack overflow in Go TS compiler — DanielLockyer · 2026-08-18
- Qwen3.8-27B Runs at 130 t/s Locally on Five-Year-Old Gaming GPUs — IgorCarron · 2026-08-18