Grok 4.6 Biology Eval: Matches Opus 5 Accuracy at a Substantially Lower Cost
kenbwork · x · 2026-08-14
Researchers evaluated the newly released Grok 4.6 model on short-horizon biology benchmarks comprising 1,716 trajectories.
The results indicate that Grok 4.6 achieves accuracy roughly on par with Opus 5 / GPT-5.6-Sol, while being substantially cheaper to run.
More from Models
- Qwen3.8 Open-Sources 2.4T Parameter MoE Flagship Model — togethercompute · 2026-08-14
- Grok Blocks Intimate Likeness Edits, Proving Musk's 'Legal = Allowed' Wrong — firasd · 2026-08-14
- Dev complains about Anthropic's silent model downgrades to Opus 4.8 — samgoodwin89 · 2026-08-14
- Kimi K3 Beats DeepSeek-V4 in Code Arena, But DeepSeek is 14x Cheaper — rohanpaul_ai · 2026-08-14
- Liquid AI's Free Model Surges: 4.3B Tokens Consumed on OpenRouter in 2 Days — maximelabonne · 2026-08-14
- DeepSeek Open-Sources Agent Framework Harness, OpenAI Launches GPT-5.6 Ultrafast — APPSO · 2026-08-14