Browser Use Bench v2 榜单刷新:GPT-6 Sol 66.9 分反超且便宜 3.5 倍
airesearch12 · x · 2026-09-23
- Browser Use 发布 Bench v2 浏览器/电脑操作基准新榜,帕累托前沿重绘:
- Claude Opus 5.5:59.4 分
- GPT-6 Sol (medium):66.9 分,成本约为 Opus 的 1/3.5
- GPT-6 Luna (xhigh):57.6 分,成本约为 Opus 的 1/22
- 结论:OpenAI 在浏览器操作用途上「独一档」,且以显著更低价格覆盖多个性能档位。所有模型可在 Browser Use 云端试用(图表 x 轴为对数刻度)。
「编程与Agent」频道最新
- JarvisGUI 基准:跨 Android/Windows/Ubuntu 考验 GUI 智能体 — maier_ak · 2026-09-23
- 开源 GUI 智能体跨设备实测:复合任务最佳成功率仅 8% — maier_ak · 2026-09-23
- 跨设备工作流一错全崩:GUI 智能体败在状态推理与长程规划 — maier_ak · 2026-09-23
- JarvisGUI:让 GUI 智能体同时操作三套系统的跨设备基准详解 — maier_ak · 2026-09-23
- 新基准 Cross-DURIAN:专测多设备 GUI 智能体跨屏协作能力 — maier_ak · 2026-09-23
- 个人 Agent 的「主动」要分层看:提醒、提案还是替你干完? — sujingshen · 2026-09-23