CMU 发布 cua-speedrun:首个统一测 computer-use agent 速度成本的基准
rsalakhu · x · 2026-10-05
CMU 团队(Lawrence Jang、Jing Yu Koh、Ruslan Salakhutdinov 等)指出 computer-use agent(CUA)评测基础设施一片混乱,存在可复现性危机:各家的任务成功率相差不大,但运行时间高度依赖评测环境,导致「让 CUA 更快」的进展几乎无法衡量。
他们为此构建了 cua-speedrun:统一的 CUA 评测基础设施,特点包括:
- 统一硬件与虚拟机:所有排行跑分在 Modal 按秒计费的同一套云端桌面环境上运行,一次 agent 接口可跨 OSWorld、OSWorld 2.0、CUA-World、MyPCBench;
- 同时记录准确率、速度与成本:不只记录是否成功,还测每个任务耗时和模型调用费用;
- 精选小任务集:保证模型排名与完整基准一致,降低重复跑分成本;
- 演示页面用 40 倍速动画对比八个 agent 在同一 OSWorld 任务上的平均耗时与得分,按时间排名。
这项工作把「速度」第一次变成可公平比较的 CUA 指标。
「编程与Agent」频道最新
- Skills/MCP/RAG/Memory 四分法:给 Agent 配对的知识机制 — MaryamMiradi · 2026-10-05
- GitHub Copilot CLI 发布 v1.0.92-4:新增 config 子命令与多项稳定性修复 — copilot-cli-release-app[bot] · 2026-10-05
- 本地内层 agent 可经 attestation 向边缘 agent 注入个人上下文 — natesiggard · 2026-10-05
- Claude Code 打造多人坦克射击游戏,Opus 编排并行 Sonnet 智能体 — IamHuggos · 2026-10-05
- 博客观点:AI Agent 需要的不是记忆插件,而是文档 — itsOmSarraf_ · 2026-10-05
- 开源剪辑工具 StreamCut 嵌入 MCP,一句话四句台词剪出四段电影片段 — chulobou · 2026-10-05