a16z 深度报告:CUA 智能体基准得分已超越人类测试者

a16z · x · 2026-08-10

a16z 发布了关于计算机使用智能体(CUA)的深度分析文章。数据显示,过去一年中 CUA 模型进步远超预期:在标准桌面操作基准测试中,最佳模型得分从去年的 42% 飙升至目前的 85%,而已知人类测试者的平均得分仅为 72%。

文章指出,CUA 已从单纯的演示阶段跨越到可规模化部署的生产阶段。目前,它们在处理系统更新、跨平台数据迁移、工单处理等狭窄但重复性高的任务上表现出色。然而,当工作流偏离预设轨道时,智能体依然显得较为脆弱。

所属事件:a16z报告:计算机控制智能体基准已超越人类(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →