Astra 在 Browser Use 基准 v2 拿 77.3%,远超 Opus 5 的 50.5%

gabrielchua · x · 2026-09-06

Browser Use Benchmark v2 最新成绩公布,Astra 表现碾压一众前沿模型:

60 个任务中有 22 个拿到满分,而 Opus 5 没有任何任务满分。作者补充:fable 模型因拒绝执行过多任务未计入有效比较。

这是浏览器自动化/Agent 领域第三方基准的一次明显洗牌,Astra 与传统 LLM 巨头之间的差距接近 27 个百分点。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →