Gemini 4 Argon 评测出炉:智能追平 GPT-6 Astra 且便宜四成
Artificial Analysis 于 10 月 1 日发布 Google Gemini 4 Argon 的完整评测:高推理档在 Intelligence Index 上得分 53,追平 GPT-6 Astra 与 Fable 5.1,比 GPT-6.1 Sol 高 1 分,在 223 个模型中排第 8(同类中位数为 26);同时成本比 GPT-6 Astra 便宜约 40%,顶级模型竞争进入胶着状态。据 @cedricchee 转述,这是 Google DeepMind 七个多月来首款超越 Flash 档的专有模型。
已确认
- AutomationBench-AA 登顶:Gemini 4 Argon 得分 77.5%,领先 Claude Sonnet 5.5(max 档,71.3%)6 个百分点(@ArtificialAnlys)。
- 智能指数 53:高推理档完整基准结果由 Artificial Analysis 分两次发布,@haider1、@cedricchee 等多人转述一致。
- 性价比:@ConsciousWarrior 指出 Gemini 4 与 GPT 6 Astra 得分相同但成本低约 40%;@vitaliychiley 补充 Argon 的成本效率落在 GPT 6.1 与 GPT-6 Astra 两代模型之间。
- 幻觉率最低:据 @idg23 转述的 Artificial Analysis 数据,Gemini 4 Argon 幻觉率仅 15%,显著低于 Grok 4.7(29%)、GPT-6 Astra(45%)、Opus 5.5(59%)和 Fable 5.1(69%),呈现宁可拒答也不编造的倾向。
- 企业级工作流领先:有用户称其在企业级工作流上表现领先 DeepSWE v1.1 和 AutomationBench,编码能力因任务而异。
- 输出上限:有用户称开启更长推理后输出上限从 64K 提升(传提至百万 token,此点尚待官方确认)。
尚未确认
- 输出上限提升至百万 token 的说法仅见于个别用户转述,未见 Artificial Analysis 官方图表直接佐证。
为什么重要
- Gemini 4 Argon 在智能追平 GPT-6 Astra 的同时价格便宜约四成,直接冲击 OpenAI 高端模型的性价比定位;加上 15% 的最低幻觉率,其可靠性优势对生产环境尤为关键;企业自动化与终端任务基准的领先也显示 Google 在 agent/自动化场景的发力。
2026-10-01 ~ 2026-10-01 · 10 条相关
- 第 1 集:Google 官宣 Gemini 4 Argon 前沿模型(2026-10-01,38 条)
- 第 2 集:Gemini 4 Argon 跑分截图流出,18 项基准 12 项登顶(2026-10-01,2 条)
- 第 3 集:Gemini 4 Argon 评测出炉:智能追平 GPT-6 Astra 且便宜四成(2026-10-01,10 条)
- 第 4 集:曝 Gemini 4 Argon 单次可输出百万 token,碾压同级模型(2026-10-01,3 条)
一手来源
- Gemini 4 Argon 高推理档跑分:智能指数 53,排第 8/223 — ArtificialAnlys ·
- Gemini 4 Argon 登顶 AutomationBench,领先 Claude Sonnet 5.5 六个百分点 — ArtificialAnlys ·
- Gemini 4 Argon 高推理模式完整基准结果出炉 — ArtificialAnlys ·
- 【源头】Gemini 4 Argon 登顶 AutomationBench,领先 Claude Sonnet 5.5 六个百分点 — ArtificialAnlys · 2026-10-01
- 【源头】Gemini 4 Argon 高推理模式完整基准结果出炉 — ArtificialAnlys · 2026-10-01
- 【源头】Gemini 4 Argon 高推理档跑分:智能指数 53,排第 8/223 — ArtificialAnlys · 2026-10-01
- Gemini 4 Argon 智能指数达 53,追平 GPT-6 Astra 成本仅六成 — cedric_chee · 2026-10-01
- Gemini 4 追平 GPT 6 Astra 跑分,价格还便宜 40% — Conscious_Warrior · 2026-10-01
- Gemini 4 Argon 智能指数得 53 分,与 GPT-6 Astra 并列第一梯队 — haider1 · 2026-10-01
- 传 Gemini 4 Argon 评测达 53 分,输出上限提至百万 token — cedric_chee · 2026-10-01
- Gemini 4 Argon 评测得分 53,性价比居 GPT 两代模型之间 — vitaliychiley · 2026-10-01
- Gemini 4 Argon 幻觉率仅15%,宁拒答不编造 — i_dg23 · 2026-10-01
另有 1 条近重复转述:Conscious_Warrior