Gemini 4 Argon 难刷 Terminal-Bench,科学版得分 12.4% 升至 57.6%

JJitsev · x · 2026-10-01

Steven Dillmann 的排行榜显示,Google DeepMind 全新模型 Gemini 4 Argon 在 Terminal-Bench-Science 上从 Gemini 3.8 Flash 的 12.4% 大幅跃升至 57.6%,位列榜单第三。

但 JJitsev 观察到一个反差:Terminal Bench 4.0 和 TB Science 0.1 这套评测很难被刷分,Gemini 4 Argon 在这两个榜单上表现不及强有力的竞品,却在其他 benchmark 上有优势 mimicking 现象。他认为这正是 Terminal Bench 建立可信评分体系的价值所在。

所属事件:Gemini 4 跑分亮眼却遭曝编码实战拉胯,刷榜质疑四起(29 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →