Gemini 4 被 cua-bench 实测拖后腿:游戏操控表现「尖刺化」

burny_tech · x · 2026-10-01

cua-bench 作者 spiceylemonade 回应外界对 Gemini 4「刷榜」的质疑:在其 computer-use 基准上,Gemini 4 得分很差(「也许 Antigravity 还需要打磨?」)。该基准要求模型玩 Minecraft、SUPERHOT 等游戏,外加若干不公开的 held-out 游戏,以防模型被定向优化(hillclimbing)。作者也承认 cua-bench 后段主要受速度瓶颈限制。

背景是被引用的爆料:报道称 Gemini 4 在行业标准基准上表现很好,但 Google 员工在实际工作中使用时表现不及预期,引发「又双叒 benchmaxxing」的争议。综合看:官方跑分与真实 agent 场景的落差正在成为社区焦点。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →