ApprenticeBench首测:顶级模型走GUI已胜过API,CUA税消失

ysu_nlp · x · 2026-09-11

Boyu Gou(SeeAct、UGround、Mind2Web 2 作者)发布 ApprenticeBench——首个针对真实会计工作中电脑使用与持续学习的 benchmark,测量模型边干边学、通过 GUI 或 API 处理账单的表现:

结论:在 100 个任务的「学习+执行」长流程中,头部模型的「CUA 税」在任务成功率上已经消失——最强 agent 走 GUI 的成功率已超过走 API。作者认为自 Opus 4 和 Sonnet 4.5 以来,computer use 一直被严重低估、评测面过窄。

所属事件:NeoCognition 发布 ApprenticeBench:首个岗位级持续学习基准(8 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →