Gemini 4 十九项测试揽十四冠,却只对受信测试者开放
alex_verem · x · 2026-10-01
作者整理 Google 自家图表:Gemini 4 在 19 项基准中 14 项登顶,包括 Harvey 法律 agent 基准 19.6%(约为 Claude Opus 5.5 与 GPT-6 Astra 的三倍),以及自动化、金融与日常知识工作;百万 token 长文档任务得 84.2%,第二名仅 71.8%。
但优势并非全面:Opus 5.5 在终端编码上领先 9 分,Astra 在科学与计算机操作上占优。作者提醒这张图是 Google 自选测试,应视为其最佳情况。
更值得警惕的是访问门槛:最强模型先交给 Fairwind Program 的「受信测试者」,且其版本关闭了网络安全护栏;公众之后开放时,顶配付费用户优先。Anthropic 今年夏天的 Mythos 也是同样打法。作者感叹前沿 AI 正变成私人会员俱乐部,开源模型仅落后约四个月且今天就能下载——他选择人人可用的版本。
所属事件:谷歌官宣 Gemini 4 Argon:百万输出 token,先交付政府与网防(104 条相关)→
「公司和人」频道最新
- Gemini 4 延期遇冷,但 Google 手握 Gmail 仍是个人 Agent 最大赢家? — sujingshen · 2026-10-01
- Reddit 因 AI 爬虫泛滥关停 RSS 订阅并终止公开 API 访问 — shield_x · 2026-10-01
- Midjourney CEO 忆少年emo:人生远比当时以为的更自由 — DavidSHolz · 2026-10-01
- 企业大脑多由开发者搭建,最不常使用的也是开发者 — femke_plantinga · 2026-10-01
- 转推分享 Peter Thiel 著名二维矩阵图集 — kevinnbass · 2026-10-01
- 欧洲 AI 学府 ELLIS 开放 2026 博士项目申请,10 月 31 日截止 — dimadamen · 2026-10-01