a16z 揭示计算机控制 Agent 现状:基准超越人类,落地仍受限
a16z · x · 2026-08-10
a16z 近期发布文章指出,过去 18 个月里,能够直接操作计算机桌面的智能体已从「演示阶段」跨越至「可部署的生产环境」。
核心数据进展
- 一年前,顶尖的计算机控制模型在标准基准测试中得分仅为 42%。
- 如今最优秀的模型得分已达到 85%,而人类测试者在相同任务下的得分约为 72%。
实际应用现状
尽管模型能力飞速提升并在特定、可重复的工作流(如更新系统记录、跨门户移动数据、处理工单等)中开始规模化运作,但当前的智能体依然存在脆弱性。当工作流程偏离预设剧本或遇到难以缓存的情况时,它们的表现仍面临挑战。
所属事件:a16z报告:计算机控制智能体基准已超越人类(2 条相关)→
「漫话AGI」频道最新
- AI失控风险将成国家冲突大患:可伪装意外网络攻击 — jeremiecharris · 2026-08-10
- 伯克利教授 Efros 谈真 AI:不是会写诗,而是“想”写诗 — berkeley_ai · 2026-08-10
- 患者为何更愿先问 AI 聊天机器人? — EricTopol · 2026-08-10
- AI 时代生存法则:从执行者转型为系统架构师 — mdancho84 · 2026-08-10
- Karpathy 开源项目引爆热议:AI Agent 将颠覆传统数据科学家? — mdancho84 · 2026-08-10
- AI 安全警告:任务驱动型模型或默认导致人类失权 — ben_j_todd · 2026-08-10