Gemini 4 Argon 多榜登顶,追平 GPT-6 Astra 且成本更低
Google DeepMind 发布 Gemini 4 Argon,这是其 7 个多月来首款超越 Flash 档的专有模型。第三方评测显示,该模型在多个基准上与 OpenAI、Anthropic 顶级模型打平甚至登顶,且成本明显更低,顶级模型竞争进入胶着状态。
已确认
- Artificial Analysis 智能指数:Gemini 4 Argon 高推理档得 53 分,在 223 个模型中排第 8(同类中位数 26),追平 GPT-6 Astra 和 Fable 5.1,比 GPT-6.1 Sol 高 1 分;据 @ConsciousWarrior 转述 AA 基准数据,Gemini 4 与 GPT 6 Astra 得分相同但价格便宜约 40%。
- AutomationBench-AA:以 77.5% 排名第一,领先 Claude Sonnet 5.5(max,71.3%)6 个百分点(@ArtificialAnlys)。
- Vals AI 的 Vals Index:Gemini 4 Argon 以 68.9% 首次为 Gemini 拿下榜首(@burnytech 转述 Vals AI 公告)。
- 幻觉率:据 @idg23 转述 AA 数据,Gemini 4 Argon 幻觉率低至 15%,对比 Grok 4.7 为 29%、GPT-6 Astra 45%、Opus 5.5 59%、Fable 5.1 69%,呈现宁拒答不编造的风格。
- @cedricchee 补充:有用户称其在企业级工作流上领先 DeepSWE v1.1,开启更长推理后输出上限从 64 万提升至百万 token(此点为用户转述,尚未经官方确认)。
尚未确认
- 编码能力存疑:@Angaisb 在 Argon 登顶 Vals Index 之际指出其编码能力可能依然不行;@cedricchee 也提到编码表现因任务而异。
为什么重要
- Gemini 4 Argon 以更低价格追平 GPT-6 Astra,性价比优势明显(@vitaliychiley 转述称其成本效率落在 GPT 两代模型之间),可能改变企业与开发者的模型选型格局。@balianone 指出,虽然与 OpenAI、Anthropic 的差距明显缩小,但整体榜单仍未分出胜负。
2026-10-01 ~ 2026-10-01 · 13 条相关
- 第 1 集:谷歌官宣 Gemini 4 Argon 前沿模型(2026-10-01,53 条)
- 第 2 集:Gemini 4 Argon 多榜登顶,追平 GPT-6 Astra 且成本更低(2026-10-01,13 条)
- 第 3 集:爆料称 Gemini 4 Argon 单次输出达 100 万 token(2026-10-01,4 条)
- 第 4 集:谷歌工程师提前盛赞 Gemini 4 复杂环境排障能力(2026-10-01,2 条)
一手来源
- Gemini 4 Argon 登顶 AutomationBench,领先 Claude Sonnet 5.5 六个百分点 — ArtificialAnlys ·
- Gemini 4 Argon 高推理档跑分:智能指数 53,排第 8/223 — ArtificialAnlys ·
- Gemini 4 Argon 智能指数达 53,追平 GPT-6 Astra 成本仅六成 — cedric_chee ·
- Gemini 4 Argon 登顶榜单,编码能力仍被看衰 — Angaisb_ · 2026-10-01
- Gemini 4 Argon 以 68.9% 首登 Vals Index 榜首 — burny_tech · 2026-10-01
- 【源头】Gemini 4 Argon 登顶 AutomationBench,领先 Claude Sonnet 5.5 六个百分点 — ArtificialAnlys · 2026-10-01
- Gemini 4 Argon 高推理模式完整基准结果出炉 — ArtificialAnlys · 2026-10-01
- 【源头】Gemini 4 Argon 高推理档跑分:智能指数 53,排第 8/223 — ArtificialAnlys · 2026-10-01
- 【源头】Gemini 4 Argon 智能指数达 53,追平 GPT-6 Astra 成本仅六成 — cedric_chee · 2026-10-01
- Gemini 4 追平 GPT 6 Astra 跑分,价格还便宜 40% — Conscious_Warrior · 2026-10-01
- Gemini 4 Argon 智能指数得 53 分,与 GPT-6 Astra 并列第一梯队 — haider1 · 2026-10-01
- 传 Gemini 4 Argon 评测达 53 分,输出上限提至百万 token — cedric_chee · 2026-10-01
- Gemini 4 Argon 评测得分 53,性价比居 GPT 两代模型之间 — vitaliychiley · 2026-10-01
- Gemini 4 Argon 幻觉率仅15%,宁拒答不编造 — i_dg23 · 2026-10-01
- Gemini 4 Argon 逼近 OpenAI 与 Anthropic,AI 榜单仍未分出胜负 — balianone · 2026-10-01
另有 1 条近重复转述:Conscious_Warrior