专题 · FULL STORY

谷歌发布多款Gemini新模型与实测

谷歌正式发布Gemini 3.6 Flash等多款主打降价提效的新模型。实测显示其效率翻倍但出现知识幻觉,同时官方透露3.5 Pro正测试且已启动Gemini 4预训练。

2026-07-21 ~ 2026-07-22 · 6 集 · 111 条

第 1 集 · 传谷歌将推Gemini 3.6 Flash,主打降价提分(2026-07-21,8 条)

近期多方信息显示,谷歌的下一代模型发布计划可能发生变动。由于备受期待的Gemini 3.5 Pro仍在延后,取而代之的可能是即将于7月下旬推出的Gemini 3.6 Flash。泄露信息指出该模型主打更低价格与更强基准成绩,引发了AI社区的广泛关注与讨论。

关键细节与泄露信息

泄露的对比表格显示,Gemini 3.6 Flash主打更低输出价格和更强的基准测试成绩。模型标识为`gemini-3.6-flash-tiered`,并且已经短暂出现在Antigravity中。在产品定位上,谷歌将其描述为面向agent(智能体)与编程任务的最强智能模型。此外,Reddit等平台有传闻称,谷歌可能已经将Gemini 3.5 Pro重命名或调整成了3.6 Flash这一档,相关内部模型ID截图中也出现了`flashLite`和`flash`等标识。

各方反应与争议

对于这一产品路线调整,社区成员看法不一。@haider1指出,目前的3.5 Flash版本虽然agentic能力很强,但指令跟随表现较差,经常漏掉关键细节。@scaling01调侃谷歌对“Pro”路线似乎十分谨慎,认为如果Flash版本表现翻车,还能拿更大的模型来兜底。@Angaisb_希望新模型能够更加省token。@CtrlAltDwayne则吐槽这可能只是“又一个昂贵的套壳”产品。此外,@ChrisGPT戏称如果OpenAI想要破坏谷歌的发布节奏,现在应该直接抛出“GPT 5.6”来狙击。目前尚无关于新模型的更多参数或官方说明。

第 2 集 · Gemini 3.6 Flash翻车:错误描述自家最新模型(2026-07-21,2 条)

谷歌最新发布的Gemini 3.6 Flash模型在早期输出中出现了令人尴尬的“翻车”现象。尽管该模型自身的知识截止日期显示为2026年5月,但它却错误地将Gemini 2.0描述为谷歌的最新模型。网友们借此制作梗图,在列举谷歌拥有Transformer、安卓及海量数据等巨大优势的同时,狠狠调侃了其AI在实际表现中的失手。

第 3 集 · 谷歌发布多款 Gemini 模型全面升级性价比(2026-07-21,67 条)

谷歌正式发布了 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及 Gemini 3.5 Flash Cyber 三款新模型,并已在 Google AI Studio、Vertex API 和 Gemini App 中上线。此次更新基于开发者对上一代模型的反馈,旨在提供更适合真实场景的大规模智能体应用,主打更强智能、更省 token 和更低价格。

关键细节与特性

Gemini 3.6 Flash 被官方定位为目前最强模型之一,主打在相同成本下用更少的 token 输出更高质量的结果。相比 3.5 Flash,新模型不仅价格更低(输入每百万 token 1.50 美元、输出每百万 token 7 美元),在完成复杂工作流时输出 token 最多减少 17%,同时减少了不必要的推理步骤和工具调用。此外,它在写生产级代码、图表分析和文档理解等多模态任务上也有提升,并能快速提取照片材质构建创意工具。另一款 3.5 Flash-Lite 则是目前最小、最快的模型之一,输出速度接近每秒 350 token,其价格与即将退役的 2.5 Flash 相同。此外,谷歌还推出了对标 Anthropic Mythos 的 3.5 Flash Cyber 模型,主攻网络安全方向。

评测与各方反应

在基准测试方面,Artificial Analysis 等机构及多位开发者的对比图显示,Gemini 3.6 Flash 在多项智能体评测中表现强势,综合智能水平领先。@bindureddy 甚至将其称为“世界上最好的聊天模型”。此外,马斯克也在推特上互动回应了此次发布。尽管外部评价颇高,但有 Reddit 网友指出,这些新模型在 AI Studio 中的实际表现似乎尚未达到谷歌官方的宣传预期。

还有 47 条相关讨论 →

第 4 集 · Gemini 3.6 Flash 跑分曝光:性能停滞但效率翻倍(2026-07-21,19 条)

Artificial Analysis 近日发布了 Google 新模型 Gemini 3.6 Flash 与 3.5 Flash-Lite 的完整基准测试结果。数据显示,新模型在智力得分上并未带来惊喜,但在运行效率与成本控制上实现了显著优化。由于核心性能停滞,外界开始质疑 Google 在大模型竞赛中的研发节奏是否已经落后。

性能表现与竞品对比

根据 Artificial Analysis 的榜单,Gemini 3.6 Flash 获得了 50 分的智力评分,其 Elo 分数达到 1421。但在关键的智力测试中,它的成绩与上一代的 Gemini 3.5 Flash 完全持平。多位网友指出该模型缺乏实质性提升,且在榜单上落后于 Meta Spark 1.1、GPT-5.6 Sol 以及 Grok 4.5 等竞品。此外,对比图表显示 Gemini 3.6 Flash 的使用成本甚至高于 GPT-5.6 Sol medium 和 Grok 4.5,但智能水平反而更低。

效率提升与成本优化

尽管绝对性能未见突破,Gemini 3.6 Flash 在效率上表现亮眼。据 Artificial Analysis 分享的数据,该模型的输出速度达到约 304 token,平均每任务耗时降至前代的一半。同时,单任务成本从 $0.59 降至 $0.50。实测体验也印证了这一点,认为 3.6 Flash 的 Token 效率确实略优于 3.5 版本。不过,Gemini 3.5 Flash-Lite 虽然速度变快,单任务成本却出现了翻倍的情况。

市场评价与争议

面对性能停滞但效率提升的现状,用户评价出现分化。有观点认为,该模型是否值得使用完全取决于实际效率;如果效率不够高,将 GPT-5.6 Sol 的 reasoning effort 调低可能是更好的替代方案。此外,通过整理基准对比表,直观展示了 Gemini 3.6 Flash 在定价、编码及代理任务等维度与 GPT-5.6 Luna、Claude Fable 5、Grok 4.5 等前沿模型的综合差距。

第 5 集 · Google启动Gemini 4预训练,3.5 Pro正合作测试(2026-07-21,13 条)

Google近期透露了其大模型产品线的最新进展:一方面,外界期待的Gemini 3.5 Pro目前正处于精选合作伙伴测试阶段,准备就绪后将更广泛地开放;另一方面,官方已正式启动下一代旗舰模型Gemini 4的预训练,并将其描述为迄今“最雄心勃勃”的训练计划,且对目前的进展感到振奋。这一动态表明,谷歌正稳步推进其大模型产品线的迭代。

关键细节与各方反应

关于Gemini 4的预训练,@kimmonismus 推测,这并非是在现有模型基础上进行微调,而是从头开始预训练一个“完全新的基础模型”。他据此猜测,Gemini 3.5 Pro近期的一些进展可能并不理想,促使谷歌重新搭建旗舰模型路线。此外,有转发信息指出,Gemini 4 未来将直接与 GPT-6 和 Grok 5 竞争。@andrew_n_carr、@himanshustwts 等多位博主则主要对这一“最雄心勃勃”的预训练阶段表达了高度期待。

第 6 集 · Google发布Gemini 3.5 Flash Cyber安全模型(2026-07-22,2 条)

Google DeepMind发布了面向网络安全的轻量级模型Gemini 3.5 Flash Cyber,限量提供给政府和可信伙伴使用。该模型经过专门微调,能够更快速高效地发现和验证漏洞。Google强调,当前AI发现漏洞的速度已超越人工修补速度,软件安全必须依赖高效强大的模型来构建。