Gemini 4 被 cua-bench 实测拖后腿:游戏操控表现「尖刺化」
burny_tech · x · 2026-10-01
cua-bench 作者 spiceylemonade 回应外界对 Gemini 4「刷榜」的质疑:在其 computer-use 基准上,Gemini 4 得分很差(「也许 Antigravity 还需要打磨?」)。该基准要求模型玩 Minecraft、SUPERHOT 等游戏,外加若干不公开的 held-out 游戏,以防模型被定向优化(hillclimbing)。作者也承认 cua-bench 后段主要受速度瓶颈限制。
背景是被引用的爆料:报道称 Gemini 4 在行业标准基准上表现很好,但 Google 员工在实际工作中使用时表现不及预期,引发「又双叒 benchmaxxing」的争议。综合看:官方跑分与真实 agent 场景的落差正在成为社区焦点。
「模型」频道最新
- 用户实测:GPT 6 系列偷懒摆烂,5.6 版却肯花数小时做质检 — jdjohnson · 2026-10-01
- 网传 DeepMind 将以半价推出碾压 Opus 5.5 的模型,遭网友质疑 — zacharynado · 2026-10-01
- 训练成本不足 5000 美元,Echo 号称风格模仿写作击败前沿模型 — Hidenori8Tanaka · 2026-10-01
- Grokipedia v0.3 上线即翻车:把普通人编成 SpaceX 高管 — NicoVerderosa · 2026-10-01
- deedy:别信跑分信定价,敢定高价才是真强模型 — deedydas · 2026-10-01
- benchmark 报告该加 95% 置信区间了:吐槽评测分数无误差线 — rmcwhorter99 · 2026-10-01