CMU 发布 cua-speedrun:给计算机使用 Agent 测速度与成本
kohjingyu · x · 2026-10-01
CMU 团队(Jing Yu Koh、Pranjal Aggarwal、Lawrence Jang 等,合作者含 Sean Welleck、Daniel Fried、Ruslan Salakhutdinov)发布 cua-speedrun,一个同时评测计算机使用 agent(CUA)准确率、速度和成本的基准系统。
- 现有基准大多只记录任务成败,不衡量完成时间和模型调用开销。
- 所有排行运行使用统一的 Modal 按秒计费虚拟机与同一条流水线,同一 agent 接口横跨 OSWorld、OSWorld 2.0、CUA-World、MyPCBench。
- 用与完整基准排名一致的小任务集,降低重复跑测成本。
- 50 任务集上:GPT-6 Astra(medium)以 1:30 / 89.6% 最快完赛,Gemini 3.8 Flash(low)1:07?实际榜单显示 Flash low 91.6% 用时 2:07;Claude Opus 5.5(xhigh)2:32 / 97.6%,准确率最高但更慢。
- 结论:时间-性能 Pareto 前沿由多家模型与不同 reasoning effort 档位混合占据(Opus 5.5、GPT-6 Astra、GPT-5.6 Luna 等)。
所属事件:CMU 发布 cua-speedrun:给电脑操作 Agent 测速度与成本(5 条相关)→
「编程与Agent」频道最新
- GPT-6.1 Astra 用 Blender MCP 生成高斯泼溅 — willeastcott · 2026-10-02
- Opus 5.5 打造的音游含 128 首曲目,可浏览器免费游玩 — TAbrodi · 2026-10-02
- Conductor 推出移动版:iPhone 上遥控一队云端编码 Agent — charlieholtz · 2026-10-02
- AI Agent 到底省不省时间?Reddit 发帖求解真实体验 — MantisReka · 2026-10-02
- Codex 装好 imagegen 技能却用不了,用户排查无果 — Reasonable-Donut-866 · 2026-10-02
- 开源 Hermes ChatGPT 扩展:在 Codex 内直接调用 Hermes 智能体 — intellectronica · 2026-10-02