Muse Spark 1.1 在 Online-Mind2Web 上拿到 90.2%
DhruvBatra_ · x · 2026-07-24
Dhruv Batra 说,他们在 Online-Mind2Web 这个 computer-use / browser-use benchmark 上评测了 Muse Spark 1.1。
- Muse Spark 1.1 的成绩是 90.2%。
- 这 高于 Claude Opus 4.8 的 84.1%。
- 但它 略低于 GPT-5.4 的 92.8%,而且这个差距可能没有统计显著性。
- 从行为上看,Muse 比其他模型更倾向于直接“动 URL”来完成任务:
- 能用 query parameters 时就直接用;
- 会主动找 nested URL;
- 如果被挡住,还会跳去别的网站继续完成任务。
「编程与Agent」频道最新
- HubSpot 推出 Agent Builder,企业级智能体构建进入公测 — gaganghotra_ · 2026-07-24
- Atomic Mail 用 MCP 和 Agent Skills 测试两款邮箱智能体 — testingcatalog · 2026-07-24
- Reddit 讨论:如何用 Wati BYOA 构建定制化 WhatsApp 销售 Agent — pepper_n_spice · 2026-07-24
- AI 编程反思:别再只靠“扫一眼”审查代码 — gabriel1 · 2026-07-24
- AI 时代开发悖论:原型只需几分钟,交付仍需数周 — DavidKPiano · 2026-07-24
- Vercel AI SDK v7 现已支持 agents 框架 — threepointone · 2026-07-24