Jev+WebMCP 跑满分,成本比 GPT-6 Astra 低 112 倍
QuanquanGu · x · 2026-09-19
WebMCP 基准团队实测:Jev 配合低价模型 Mercury 2.5 与 WebMCP 协议,在 49 个浏览器任务上 100% 全解,模型成本比用代码执行的 GPT-6 Astra 低约 112 倍,比截图式 computer use 低 245 倍。
对比显示,单靠浏览器控制 Jev 准确率一般,仅解决 25/49 任务;接入 WebMCP 后翻倍到 49/49,同时成本进一步下降。团队使用 Browser Use 开源 Ultrafast 并改进了测试框架。
Aditya Grover 猜测 Jev 本身是扩散式 LLM(dLLM):并行生成 JSON 等结构化输出类似 dLLM 的 infill 采样,这正是其在 WebMCP 上表现突出的原因。
所属事件:Jev+WebMCP 全解 49 项浏览器任务,成本远低于 GPT-6 Astra(3 条相关)→
「编程与Agent」频道最新
- willcb:上下文学习要胜任个人持续学习,得靠「怪异」神经符号 harness — willcb · 2026-09-19
- 在线RL才是当前真正可用的方案:从真实交互轨迹构建任务飞轮 — willcb · 2026-09-19
- 开发者实测:Codex 值 200 美元档,Claude 100 美元够用 — lxfater · 2026-09-19
- AgentSky 上线:浏览器免装调用 40+ 编码 Agent 可横向比价 — Aiden_Tech_Ai · 2026-09-19
- qwen-code SDK v0.1.13 发布:微压缩修复保住长会话提示词缓存 — github-actions[bot] · 2026-09-19
- 从脚本到推理模型:决策类任务正被拆出第三层架构 — arpit_bhayani · 2026-09-19