Browser Use Bench v2: GPT-6 Sol scores 66.9, beating Opus 5.5 at 3.5x lower cost
airesearch12 · x · 2026-09-23
- Browser Use released Bench v2 for computer/browser use, redrawing the Pareto frontier:
- Claude Opus 5.5: 59.4
- GPT-6 Sol (medium): 66.9, 3.5x cheaper
- GPT-6 Luna (xhigh): 57.6, 22x cheaper than Opus
- Takeaway: OpenAI is in its own league for browser-use tasks, covering multiple price-performance tiers; all models are available on Browser Use's cloud (log-scale chart).
More from coding & agent
- Open-source GUI agents top out at 8% task success on composite cross-device tasks — maier_ak · 2026-09-23
- JarvisGUI benchmark tests GUI agents across Android, Windows and Ubuntu in one workflow — maier_ak · 2026-09-23
- Cross-DURIAN: A New Benchmark for Multi-Device GUI Agents — maier_ak · 2026-09-23
- "Proactive" personal agents: reminder, proposal, or acting without asking? — sujingshen · 2026-09-23
- AWS Open-Sources Strands Harness, Claims 28% Fewer Agent Tokens — shashib · 2026-09-23
- Before your AI agent pays for you: four questions about authorization and billing — sujingshen · 2026-09-23