首次量化证实:Claude 与 GPT 用 GUI 已追平 API 能力
ysu_nlp · x · 2026-09-12
一条关于 computer-use agents(CUA)的量化评测转发:首次给出证据显示 Claude 与 GPT 系模型在 GUI 操作能力上快速进步,Fable 5.1 和 GPT-6 Astra 用 GUI 的表现已与 API 相当,「CUA 税」不复存在。其他模型仍有差距,如 Grok 4.6 API 能力强但 GUI 场景性能下降 71%。
「模型」频道最新
- AI 攻克千禧年数学难题:加速进展背后的双面叙事 — pstAsiatech · 2026-09-12
- V4.1 在 Terminal-Bench-Science 拿 11/70,物理科学表现超 Opus 5 — teortaxesTex · 2026-09-12
- 用户吐槽 Grok 聊天搜索不支持布尔运算,越搜越多 — chrisgrayson · 2026-09-12
- 传 Google 即将发布新模型,预期超越 GPT 5.6 Sol — imjustnewatai · 2026-09-12
- 键盘手向最强模型下战书:能否复刻一首歌的专业键盘演出音色 — AdBest4099 · 2026-09-12
- xAI 曾宣布本周发布 Grok 4.7,如今却称'还需再打磨' — alejandroll10 · 2026-09-12