CMU 评测 Jev 计算机使用 agent:准确率低 10 倍、慢 1.5 倍

wellecks · x · 2026-10-03

卡内基梅隆大学团队推出 cua-speedrun 评测系统,首次把「速度」和「成本」纳入计算机使用 agent(CUA)基准,并在其上评测了 Jev,结果出人意料:

cua-speedrun 的设计:

计时范围涵盖截图、模型调用、键鼠操作的完整循环,硬件、桌面、任务与计时全部固定,使时间与成本差异可归因于 agent 本身。项目由 Pranjal Aggarwal、Lawrence Keunho Jang、Sean Welleck、Daniel Fried、Ruslan Salakhutdinov、Jing Yu Koh 等人完成。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →