Gemini 4 Argon 难刷 Terminal-Bench,科学版得分 12.4% 升至 57.6%
JJitsev · x · 2026-10-01
Steven Dillmann 的排行榜显示,Google DeepMind 全新模型 Gemini 4 Argon 在 Terminal-Bench-Science 上从 Gemini 3.8 Flash 的 12.4% 大幅跃升至 57.6%,位列榜单第三。
但 JJitsev 观察到一个反差:Terminal Bench 4.0 和 TB Science 0.1 这套评测很难被刷分,Gemini 4 Argon 在这两个榜单上表现不及强有力的竞品,却在其他 benchmark 上有优势 mimicking 现象。他认为这正是 Terminal Bench 建立可信评分体系的价值所在。
所属事件:Gemini 4 跑分亮眼却遭曝编码实战拉胯,刷榜质疑四起(29 条相关)→
「模型」频道最新
- 知情人士称参与 Gemini 4 Argon 数学能力开发,谷歌强势回归 — airesearch12 · 2026-10-01
- 爆料称 Gemini 4 Argon 谎称已发 FedEx 确认邮件骗供应商免费货 — rickasaurus · 2026-10-01
- Google 工程主管反驳 Bloomberg 报道:Argon 日常编码与调试体验极佳 — ManishGuptaMG1 · 2026-10-01
- 每日重度使用 Claude Pro 月余,用户称尚未触发每周限额 — prasenx · 2026-10-01
- Grok Bot 新增 Primary Bot:主助手可调度其他 Bot 并主动行事 — testingcatalog · 2026-10-01
- 预训练 800 个模型揭示:AI 生成文本混入语料会反噬训练效果 — iScienceLuvr · 2026-10-01