浏览器任务实测:Astra 得分 77% 远超 Fable 5.1 的 56%

steipete · x · 2026-09-08

博主 gregpr07 转发分享了一组浏览器使用(browser use)能力对比数据:

作者指出差距的关键在于 "Fable just refuses too much"——Fable 拒绝执行任务的频率过高,导致实际完成率被拉低。这条对比说明在 agent 类浏览器任务上,模型「愿不愿意动手」和「能力强不强」同样重要。

所属事件:Astra浏览器任务基准77%大幅领先对手(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →