浏览器任务实测:Astra 得分 77% 远超 Fable 5.1 的 56%
steipete · x · 2026-09-08
博主 gregpr07 转发分享了一组浏览器使用(browser use)能力对比数据:
- Astra 得分 77%,明显领先
- Fable 5.1 仅 56%
作者指出差距的关键在于 "Fable just refuses too much"——Fable 拒绝执行任务的频率过高,导致实际完成率被拉低。这条对比说明在 agent 类浏览器任务上,模型「愿不愿意动手」和「能力强不强」同样重要。
所属事件:Astra浏览器任务基准77%大幅领先对手(2 条相关)→
「模型」频道最新
- Similarweb:ChatGPT 月活破 10.6 亿,连续 4 个月创新高 — FinanceYF5 · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11
- 实测发现 OpenRouter 不稳定支持 Meta Muse effort 档位,欧盟付费也受阻 — PawelHuryn · 2026-09-11
- 用户实测:Codex 单轮烧掉 4700 积分,$200 额度 20 分钟未完成任务 — RileyRalmuto · 2026-09-11