CMU 评测 Jev 计算机使用 agent:准确率低 10 倍、慢 1.5 倍
wellecks · x · 2026-10-03
卡内基梅隆大学团队推出 cua-speedrun 评测系统,首次把「速度」和「成本」纳入计算机使用 agent(CUA)基准,并在其上评测了 Jev,结果出人意料:
- Jev 比 Opus-5.5-xHigh 慢 1.5 倍
- 准确率低 10 倍
- 步数多 5 倍
- 综合水平只相当于 GPT-4 一档,时间上接近 Astra-xHigh
cua-speedrun 的设计:
- 传统基准只记录是否成功,该系统同时测量每个任务的耗时与模型调用成本
- 所有榜单运行使用统一 pipeline 和虚拟机(部署在 Modal 按秒计费云服务上)
- 单一 agent 接口可跨 OSWorld、OSWorld 2.0、CUA-World、MyPCBench 运行
- 通过精选小任务集(保证模型排名与全量基准一致)控制重复运行成本
计时范围涵盖截图、模型调用、键鼠操作的完整循环,硬件、桌面、任务与计时全部固定,使时间与成本差异可归因于 agent 本身。项目由 Pranjal Aggarwal、Lawrence Keunho Jang、Sean Welleck、Daniel Fried、Ruslan Salakhutdinov、Jing Yu Koh 等人完成。
「模型」频道最新
- IFM 开源 K2-Type-0.9B:0.9B 决策模型单次前向输出校准概率 — HongyiWang10 · 2026-10-03
- 前 Meta 研究员加入 Prime Intellect,将参与打造 INTELLECT-4 开源模型 — willcb · 2026-10-03
- Claude 应用内测头像自定义功能,开始逐步推送 — testingcatalog · 2026-10-03
- GPT-6.1 Sol 达多步逆合成基准 SOTA,35% 分子成功求解 — DeryaTR_ · 2026-10-03
- 双卡跑 262K 上下文:三个补丁把 Strata 推理提速至 130 tok/s — Fz1zz · 2026-10-03
- Grok Bot 用量额度重置,网友庆祝周末畅玩 — mark_k · 2026-10-03