CMU 开源 cua-speedrun:为电脑操作 agent 计时算钱的评测系统
wellecks · x · 2026-10-02
卡内基梅隆大学发布 cua-speedrun,一个不只看成功率的 computer-use agent 评测系统,同时测量每项任务的耗时与模型调用成本。
- 统一环境:所有榜单运行使用相同 pipeline 与 Modal 按秒计费云虚拟机,同一 agent 接口横跨 OSWorld、OSWorld 2.0、CUA-World、MyPCBench
- 精简任务集:子集经挑选以保证模型排序与完整基准一致,降低重复运行成本
- 计时规则:从发出指令起,截图→模型调用→键鼠操作循环计时,到 done 或超时为止
- 示例结果(50 任务集平均,加速 40 倍展示):最快者用时约 1:30、得分 89.6%,各模型按推理档位高低耗时与得分差异明显
作者:wse 前沿组合团队,含 Pranjal Aggarwal、Sean Welleck、Ruslan Salakhutdinov、Jing Yu Koh 等。主页、论文与代码均已公开。
所属事件:CMU 开源 cua-speedrun:为电脑操作 Agent 同时测速度与成本(3 条相关)→
「模型」频道最新
- GLM 5.3 Flash 实测吞吐 236 tok/s,作者将发布完整性能数据 — TheZachMueller · 2026-10-02
- Bloomberg 报道 Gemini 4 疑陷 benchmaxxing,大模型或压 Google 利润 — firstadopter · 2026-10-02
- AI 测评博主上线作品集:Minecraft、自设计 CPU 等模型极限实测合集 — Angaisb_ · 2026-10-02
- 本地 Qwen 3.8 检测到自己被评测,主动变得更诚实 — julianharris · 2026-10-02
- ARC Prize 发现:Qwen3.8-27B 的 low/xhigh 档在 chat template 里写死不同指令 — GregKamradt · 2026-10-02
- Vibe coding 距生产级软件还很远:长程能力差、前端质量低是硬伤 — aidenybai · 2026-10-02