Gemini 4 十九项测试揽十四冠,却只对受信测试者开放

alex_verem · x · 2026-10-01

作者整理 Google 自家图表:Gemini 4 在 19 项基准中 14 项登顶,包括 Harvey 法律 agent 基准 19.6%(约为 Claude Opus 5.5 与 GPT-6 Astra 的三倍),以及自动化、金融与日常知识工作;百万 token 长文档任务得 84.2%,第二名仅 71.8%。

但优势并非全面:Opus 5.5 在终端编码上领先 9 分,Astra 在科学与计算机操作上占优。作者提醒这张图是 Google 自选测试,应视为其最佳情况。

更值得警惕的是访问门槛:最强模型先交给 Fairwind Program 的「受信测试者」,且其版本关闭了网络安全护栏;公众之后开放时,顶配付费用户优先。Anthropic 今年夏天的 Mythos 也是同样打法。作者感叹前沿 AI 正变成私人会员俱乐部,开源模型仅落后约四个月且今天就能下载——他选择人人可用的版本。

所属事件:谷歌官宣 Gemini 4 Argon:百万输出 token,先交付政府与网防(104 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →