ApprenticeBench首测:顶级模型走GUI已胜过API,CUA税消失
ysu_nlp · x · 2026-09-11
Boyu Gou(SeeAct、UGround、Mind2Web 2 作者)发布 ApprenticeBench——首个针对真实会计工作中电脑使用与持续学习的 benchmark,测量模型边干边学、通过 GUI 或 API 处理账单的表现:
- Fable 5.1:GUI 72% vs API 70%
- GPT-6 Astra:GUI 68% vs API 65%
结论:在 100 个任务的「学习+执行」长流程中,头部模型的「CUA 税」在任务成功率上已经消失——最强 agent 走 GUI 的成功率已超过走 API。作者认为自 Opus 4 和 Sonnet 4.5 以来,computer use 一直被严重低估、评测面过窄。
所属事件:NeoCognition 发布 ApprenticeBench:首个岗位级持续学习基准(8 条相关)→
「编程与Agent」频道最新
- Notion 推出 MCP:跨工具跨模型携带你的记忆与上下文 — _AustinCalvert_ · 2026-09-11
- Scott Belsky:渐进式个性化与信任是 Agent 的第一公里新 UX — _AustinCalvert_ · 2026-09-11
- 多家金融巨头自建团队复刻 Pydantic Monty,创始人称入场太晚 — samuelcolvin · 2026-09-11
- 博主横评 GLM 5.3 Flash 与 DeepSeek V4.1:Solo 最优,Agent 团队踩脚 — teortaxesTex · 2026-09-11
- AI 电影工作室自研 3D 镜头预演工具,先摆机位再烧生成额度 — purecharisma2020 · 2026-09-11
- 马斯克转曝:SpaceXAI 团队下周直播用 Grok 从零建一家公司 — elonmusk · 2026-09-11