CMU 发布 cua-speedrun:首个统一测 computer-use agent 速度成本的基准

rsalakhu · x · 2026-10-05

CMU 团队(Lawrence Jang、Jing Yu Koh、Ruslan Salakhutdinov 等)指出 computer-use agent(CUA)评测基础设施一片混乱,存在可复现性危机:各家的任务成功率相差不大,但运行时间高度依赖评测环境,导致「让 CUA 更快」的进展几乎无法衡量。

他们为此构建了 cua-speedrun:统一的 CUA 评测基础设施,特点包括:

这项工作把「速度」第一次变成可公平比较的 CUA 指标。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →