专题 · FULL STORY

Gemini 4 Argon:从传闻到评测的十月初炸场

Google 下一代前沿模型 Gemini 4 Argon 在大量传闻发酵后,由 CEO Pichai 于 10 月 1 日提前官宣。随后跑分截图流出,显示 18 项基准中 12 项登顶;Artificial Analysis 评测称其智能追平 GPT-6 Astra 且价格便宜四成,另有爆料称单次输出可达百万 token。

2026-10-01 ~ 2026-10-01 · 4 集 · 57 条

第 1 集 · Google 官宣前沿模型 Gemini 4 Argon(2026-10-01,41 条)

10 月 1 日,Google CEO Sundar Pichai 在外界大量传闻下提前官宣下一代前沿模型 Gemini 4 Argon,Google DeepMind 官方账号与官方博客随即正式发布。模型定位为复杂工作流、软件工程、企业知识工作与网络防御方向的前沿模型,发布当日已先行交付美国政府并通过 Fairwind 计划向受信网络防御者开放,后续将尽快向所有用户开放。

已确认

  • Pichai 称 Gemini 4 Argon 在复杂工作流、网络防御和软件工程上达到前沿水平,Google 内部团队从编程到量子计算已大量使用并反馈良好;模型带有前沿安全护栏,会「尽可能快且尽可能安全」地扩大可用性。
  • 官方规格:输出 token 上限从此前的 64K 大幅跃升至 100 万,官方称可让模型在一次运行中解决长链条、多步骤问题;早期测试者反馈将用于在更广泛开放前强化模型。
  • 定价:Google DeepMind 高管 Logan Kilpatrick 官宣介绍期定价为每百万 token 输入 $2、输出 $10,即日起先向网络防御者开放,随后尽快扩大范围。
  • Gemini 产品负责人 Tulsee Doshi 表示,分阶段发布(先给受信网络安全伙伴、配合美国政府安全评估)既增强信心,也能让网络防御方向训练有素的模型尽快交到防御者手中;她与员工 ammaar 均确认模型已开始向受信网络防御者推送。
  • Google 官方博客「Introducing Gemini 4」页面已上线,发布落定。

尚未确认

  • 有帖子称 Argon 在真实世界长程(long-horizon)软件工程任务上创下新 SOTA、多项基准显著提升,并有说法称在编程与网络安全基准上持平或超越 OpenAI 和 Anthropic 的领先模型;这些多为转述汇总,具体基准数字以官方博客与后续基准预览为准。
  • Polymarket 发帖并附「年底第一 AI 模型」预测市场上 Google 93% 的概率,带有玩梗色彩,非官方信息。

为什么重要

  • Argon 延续并强化了谷歌与美国政府、受信网络安全测试者合作评估的流程,安全护栏先行、面向防御者优先开放,显示前沿模型发布正与国家安全场景深度绑定。
  • 输出上限 100 万 token 加上 $2/$10 的低介绍期定价,大幅拉低长程自主任务与智能体式工作流的使用门槛,也是谷歌一个月内连发多款前沿模型节奏的延续,有网友感叹「每个新的都把旧的干掉」。

还有 21 条相关讨论 →

第 2 集 · Gemini 4 Argon 跑分截图流出,18 项基准 12 项登顶(2026-10-01,2 条)

Reddit 用户放出据称是 Google 未发布旗舰模型 Gemini 4 Argon 的跑分截图,显示其在 18 项基准中拿下 12 项第一,对比对象包括 Fable 5.1、Opus 5.5 等模型,评论区以「Google locked in」盛赞 Google 状态拉满。该模型此前已由 Google 官宣,此次泄露进一步推高外界期待。

第 3 集 · Gemini 4 Argon 评测出炉:智能追平 GPT-6 Astra 且便宜四成(2026-10-01,10 条)

Artificial Analysis 于 10 月 1 日发布 Google Gemini 4 Argon 的完整评测:高推理档在 Intelligence Index 上得分 53,追平 GPT-6 Astra 与 Fable 5.1,比 GPT-6.1 Sol 高 1 分,在 223 个模型中排第 8(同类中位数为 26);同时成本比 GPT-6 Astra 便宜约 40%,顶级模型竞争进入胶着状态。据 @cedricchee 转述,这是 Google DeepMind 七个多月来首款超越 Flash 档的专有模型。

已确认

  • AutomationBench-AA 登顶:Gemini 4 Argon 得分 77.5%,领先 Claude Sonnet 5.5(max 档,71.3%)6 个百分点(@ArtificialAnlys)。
  • 智能指数 53:高推理档完整基准结果由 Artificial Analysis 分两次发布,@haider1、@cedricchee 等多人转述一致。
  • 性价比:@ConsciousWarrior 指出 Gemini 4 与 GPT 6 Astra 得分相同但成本低约 40%;@vitaliychiley 补充 Argon 的成本效率落在 GPT 6.1 与 GPT-6 Astra 两代模型之间。
  • 幻觉率最低:据 @idg23 转述的 Artificial Analysis 数据,Gemini 4 Argon 幻觉率仅 15%,显著低于 Grok 4.7(29%)、GPT-6 Astra(45%)、Opus 5.5(59%)和 Fable 5.1(69%),呈现宁可拒答也不编造的倾向。
  • 企业级工作流领先:有用户称其在企业级工作流上表现领先 DeepSWE v1.1 和 AutomationBench,编码能力因任务而异。
  • 输出上限:有用户称开启更长推理后输出上限从 64K 提升(传提至百万 token,此点尚待官方确认)。

尚未确认

  • 输出上限提升至百万 token 的说法仅见于个别用户转述,未见 Artificial Analysis 官方图表直接佐证。

为什么重要

  • Gemini 4 Argon 在智能追平 GPT-6 Astra 的同时价格便宜约四成,直接冲击 OpenAI 高端模型的性价比定位;加上 15% 的最低幻觉率,其可靠性优势对生产环境尤为关键;企业自动化与终端任务基准的领先也显示 Google 在 agent/自动化场景的发力。

第 4 集 · 爆料称 Gemini 4 Argon 单次输出达 100 万 token(2026-10-01,4 条)

有未经官方确认的爆料称,Google 新旗舰 Gemini 4 公开版沿用内部代号 Argon,单次响应最多可输出 100 万 token,约为同级模型 128K 输出上限的 8 倍,且强调这是输出而非输入上下文上限。爆料还称其在多数基准测试上超过 GPT-6 Astra 与 Claude Opus 5.5,全面领先各头部前沿模型。