Astra 在 Browser Use 基准 v2 拿 77.3%,远超 Opus 5 的 50.5%
gabrielchua · x · 2026-09-06
Browser Use Benchmark v2 最新成绩公布,Astra 表现碾压一众前沿模型:
- Astra medium:77.3%
- Opus 5:50.5%
- GPT-5.6 Sol xhigh:49.1%
60 个任务中有 22 个拿到满分,而 Opus 5 没有任何任务满分。作者补充:fable 模型因拒绝执行过多任务未计入有效比较。
这是浏览器自动化/Agent 领域第三方基准的一次明显洗牌,Astra 与传统 LLM 巨头之间的差距接近 27 个百分点。
「模型」频道最新
- Ollama CEO:企业 80-90% token 将由开源模型承担,仅占成本 10-20% — victor_explore · 2026-09-06
- Chat 升级后翻车?用户抱怨其陷入过度复杂化死循环 — marcoshsq · 2026-09-06
- OpenAI 桌面端现 Astra 模型选项,配 X-high 快速模式获好评 — beffjezos · 2026-09-06
- 开发者自曝单周跑 200 亿 token,Codex 用量额度被赞疯狂 — rudrank · 2026-09-06
- 开发者解读当前模型发布套路:通用小幅提升+专项数据喂出新技能 — xiaosun86 · 2026-09-06
- Astra 视觉空间智能进展显著,新基准 SpatialBench 成绩惊人 — socoolandawesome · 2026-09-06