CMU 发布 cua-speedrun:同分下 computer-use agent 速度差距可达 4.4 倍
arankomatsuzaki · x · 2026-10-01
CMU 团队(含 Ruslan Salakhutdinov、Jing Yu Koh 等)推出 cua-speedrun,一个同时测量 computer-use agent 完成任务的时间与模型调用成本的评测系统,而多数基准只记录成功与否。由 Andrej Karpathy 转发关注。
- 统一在 Modal 的按秒计费云虚拟机与同一条 agent 流水线上跑 OSWorld、OSWorld 2.0、CUA-World、MyPCBench
- 50 任务子集经筛选后模型排序与完整基准一致,控制复跑成本
- 早期结果:同样拿到 89.6% 分数的任务里,GPT-6 Astra 平均每任务 1:30,而 Kimi K3 需 7:23,速度差 4.4 倍;Gemini 3.8 Flash、Claude Opus 5、Sonnet 5 等多档位成绩一并列出
- 结论:agent 之间除质量外,速度与成本的差距同样巨大,应成为选型关键维度
「编程与Agent」频道最新
- Tripo API 接入 Unbound,3D 生成资产可实时雕刻导出 — yshan2u · 2026-10-01
- 资深游戏开发者列出 10 个 AI 省时用法:从查崩溃日志到修 CMake — draginol · 2026-10-01
- NVIDIA Mid-Harness:执行前采样验证动作,TerminalBench Pass@1 升至 68% — nvidia · 2026-10-01
- Amazon SMART 自进化多智能体字幕翻译:15 个语向 MQM 全部最佳 — amazon · 2026-10-01
- Gary Bernhardt:对 AI Agent 信心跌至谷底,删测试也算修好 — sidjustice_ · 2026-10-01
- 「Agent 就是新的软件形态」,PurzBeats 呼吁开发者入场 — PurzBeats · 2026-10-01