专题 · FULL STORY

Gemini 3.6 Flash发布:从传闻到实测的全过程

谷歌新一代模型Gemini 3.6 Flash历经传闻曝光与早期翻车后正式发布。实测表明该模型虽在速度与性价比上大幅提升,但智力表现并未跨越,同时官方还宣布了Gemini 4的预训练进展。

2026-07-21 ~ 2026-07-27 · 5 集 · 188 条

第 1 集 · 曝谷歌将发Gemini 3.6 Flash,主打智能体且降价提分(2026-07-21,10 条)

近期多方泄露信息显示,谷歌即将于7月下旬发布新一代模型。由于备受期待的Gemini 3.5 Pro仍在延后,取而代之的将是主打智能体与编程任务的Gemini 3.6 Flash。泄露的对比表格和模型卡显示该模型实现了降价提分,引发了AI社区的广泛关注与讨论。

关键细节与泄露信息

爆料称谷歌将一口气发布三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite和专攻网络安全的3.5 Flash Cyber,但并未推出3.5 Pro。其中,标识为gemini-3.6-flash-tiered的Gemini 3.6 Flash已短暂出现在Antigravity中。该模型专为复杂知识工作、编码和智能体工作流设计,输出Token减少17%,DeepSWE基准测试从37%跃升至49%,定价为每百万输出Token更低的价格。此外,Reddit等平台有传闻称,谷歌可能已经将Gemini 3.5 Pro重命名或调整成了3.6 Flash这一档,相关内部模型ID截图中也出现了flashLite和flash等标识。

各方反应与争议

对于这一产品路线调整,社区成员看法不一。@haider1指出,目前的3.5 Flash版本虽然agentic能力很强,但指令跟随表现较差,经常漏掉关键细节。@scaling01调侃谷歌对“Pro”路线似乎十分谨慎,认为如果Flash版本表现翻车,还能拿更大的模型来兜底。@Angaisb希望新模型能够更加省token。@CtrlAltDwayne则吐槽这可能只是“又一个昂贵的套壳”产品。此外,@ChrisGPT戏称如果OpenAI想要破坏谷歌的发布节奏,现在应该直接抛出“GPT 5.6”来狙击。目前尚无关于新模型的更多参数或官方说明。

第 2 集 · Gemini 3.6 Flash翻车:错误描述自家最新模型(2026-07-21,2 条)

谷歌最新发布的Gemini 3.6 Flash模型在早期输出中出现了令人尴尬的“翻车”现象。尽管该模型自身的知识截止日期显示为2026年5月,但它却错误地将Gemini 2.0描述为谷歌的最新模型。网友们借此制作梗图,在列举谷歌拥有Transformer、安卓及海量数据等巨大优势的同时,狠狠调侃了其AI在实际表现中的失手。

第 3 集 · 谷歌发布三款全新 Gemini 模型并宣布 Gemini 4 预训练(2026-07-21,157 条)

谷歌正式发布了 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及 Gemini 3.5 Flash Cyber 三款新模型,并已在 Google AI Studio、Vertex API 和 Gemini App 等平台上线。此次更新基于开发者对上一代模型的反馈,旨在提供更适合真实场景的大规模智能体应用,核心主打更强智能、更省 token 和更低价格。此外,官方透露 Gemini 4 已进入预训练阶段,马斯克也发帖回应了此次发布。

已确认

Gemini 3.6 Flash 被官方定位为目前最强模型之一,主打在相同成本下用更少的 token 输出更高质量的结果。相比 3.5 Flash,新模型不仅定价更低(输入每百万 token 1.50 美元、输出每百万 token 7 美元),在完成复杂工作流时输出 token 最多减少 17%,同时减少了不必要的推理步骤和工具调用。它在写生产级代码、图表分析和文档理解等多模态任务上也有提升,并能快速提取照片材质构建创意工具。另一款 3.5 Flash-Lite 则是目前最小、最快的模型之一,输出速度接近每秒 350 token,其价格与即将退役的 2.5 Flash 相同。此外,谷歌还推出了对标 Anthropic Mythos 的 3.5 Flash Cyber 模型,主攻网络安全方向,目前限量供政府和可信伙伴使用。

尚未确认

在基准测试与实际性价比方面,外部评价存在严重分歧。@CounterReady4774 等开发者的对比图显示 Gemini 3.6 Flash 在多项智能体评测中表现强势,@bindureddy 甚至将其称为“世界上最好的聊天模型”。然而 @bindureddy 也指出该模型在某些基准跑分中低于上一代 3.5 Flash,且比 Grok 和 Luna 更贵;@truecakesnake 根据 Artificial Analysis 数据称其跑分与 3.5 Flash 基本持平;@XFreeze 也对比指出其同任务成本竟高于 Grok 4.5。这些争议表明,新模型在实际应用中的性价比可能并未完全达到官方宣传的预期。

为什么重要

在密集发布新一代模型的同时,谷歌 Logan Kilpatrick 等人透露,Gemini 4 已经进入“迄今最雄心勃勃”的预训练阶段。据 @kimmonismus 转述,Gemini 4 将是一个完全新的基础模型,目前进展令人振奋。这表明谷歌正通过高频迭代和细分场景(如安全、高频低成本任务)加速抢占 AI 市场。

还有 137 条相关讨论 →

第 4 集 · Gemini 3.6 Flash 评测:更快更省但未变更聪明(2026-07-22,16 条)

Google 最新发布的 Gemini 3.6 Flash 引发了社区的广泛实测与讨论。该模型在效率上实现了显著跃升,速度提升约两倍,价格下调 18%,且 token 消耗有所减少。然而,独立评测普遍指出其核心智能水平并未随之升级,整体表现与上代持平,在部分能力上甚至出现退步,引发了关于其性价比和升级价值的质疑。

已确认

在整体智能评估上,多位作者指出 Gemini 3.6 Flash 在 Artificial Analysis (AA) 指数上得分 50,与前代完全持平。@haider1 与 @emax 等人强调,尽管新模型在编程榜单(如 DeepSWE 得分从 37% 升至 49%)有所进步,但整体表现仍落后于 GPT-5.6 Sol、Terra 等竞品,且在对比中被指比 GPT-5.6 Luna 贵出 2.5 倍。@skalskip92 与 @llamaindex 的测试发现模型在目标检测和图表理解(ParseBench 掉点 14%)上出现明显退步,@scaling01 也指出其在 WeirdML 测试中常因计划过于复杂而导致超时。在特定应用场景中,该模型展现了强劲实力:@allenainie 提到其在 browseruse 的 Web 智能体任务测试中取得 68% 的高分,超越 GPT-5.6-sol 与 Sonnet 4.6;@mertdumenci 高度评价了其在搜索型任务中的落地体验;@bytebot 也证实其多模态能力依然保持在线,且网页端使用速度极快。

尚未确认

关于该模型是否在主观体验上变得更聪明,社区反馈存在分歧。@sankineth 在简单试用后认为模型“明显更聪明了”,但这属于个体主观感受,与多数基准测试得出的“智能持平”结论存在差异。

为什么重要

该模型的发布策略反映了 Google 的路线调整。@PaiDxng 认为 Google 试图通过更好的官方基准数字和 token 优化来推动用户升级,但回归测试的结果可能会阻碍这一进程。@sujingshen 分享的第三方报告指出,Google 正在将策略转向在持平能力下降低 30-40% 的成本。然而,@burkov 直言,基于前端代码竞技场(Frontend Code Arena)等榜单的数据,Google 目前已在顶级模型竞争中落后于至少 6 家实验室。整体而言,Gemini 3.6 Flash 是一次侧重于效率与特定智能体能力的迭代,而非基础智能的飞跃。

第 5 集 · Google连发三款Gemini新模型主打高性价比(2026-07-27,3 条)

Google 近期一口气推出了 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber 等三款新模型。其中,Gemini 3.6 Flash 被业界视为 Google 打出的“效率牌”,其编码能力相比上一代得到提升。该模型以极低的成本提供了媲美 Sonnet 质量的表现,显示出 Google 在 AI 效率与成本控制上的明确押注。