Gemini 3.6 Flash 评测:更快更省但核心智能未升级
Google 最新发布的 Gemini 3.6 Flash 引发了社区的广泛实测与讨论。该模型在效率上实现了显著跃升,速度提升约两倍,价格下调 18%,且 token 消耗有所减少。然而,独立评测普遍指出其核心智能水平并未随之升级,整体表现与上代持平,在部分能力上甚至出现退步,引发了关于其性价比和升级价值的质疑。
已确认
在整体智能评估上,多位作者指出 Gemini 3.6 Flash 在 Artificial Analysis (AA) 指数上得分 50,与前代完全持平。@haider1 与 @emax 等人强调,尽管新模型在编程榜单(如 DeepSWE 得分从 37% 升至 49%)有所进步,但整体表现仍落后于 GPT-5.6 Sol、Terra 等竞品,且在对比中被指比 GPT-5.6 Luna 贵出 2.5 倍。@skalskip92 与 @llama_index 的测试发现模型在目标检测和图表理解(ParseBench 掉点 14%)上出现明显退步,@scaling01 也指出其在 WeirdML 测试中常因计划过于复杂而导致超时。在特定应用场景中,该模型展现了强劲实力:@allenainie 提到其在 browser_use 的 Web 智能体任务测试中取得 68% 的高分,超越 GPT-5.6-sol 与 Sonnet 4.6;@mertdumenci 高度评价了其在搜索型任务中的落地体验;@bytebot 也证实其多模态能力依然保持在线,且网页端使用速度极快。
尚未确认
关于该模型是否在主观体验上变得更聪明,社区反馈存在分歧。@sankin_eth 在简单试用后认为模型“明显更聪明了”,但这属于个体主观感受,与多数基准测试得出的“智能持平”结论存在差异。
为什么重要
该模型的发布策略反映了 Google 的路线调整。@PaiDxng 认为 Google 试图通过更好的官方基准数字和 token 优化来推动用户升级,但回归测试的结果可能会阻碍这一进程。@sujingshen 分享的第三方报告指出,Google 正在将策略转向在持平能力下降低 30-40% 的成本。然而,@burkov 直言,基于前端代码竞技场(Frontend Code Arena)等榜单的数据,Google 目前已在顶级模型竞争中落后于至少 6 家实验室。整体而言,Gemini 3.6 Flash 是一次侧重于效率与特定智能体能力的迭代,而非基础智能的飞跃。
2026-07-22 ~ 2026-07-23 · 16 条相关
- 第 1 集:曝谷歌将发Gemini 3.6 Flash,主打智能体且降价提分(2026-07-21,10 条)
- 第 2 集:Gemini 3.6 Flash翻车:错误描述自家最新模型(2026-07-21,2 条)
- 第 3 集:谷歌发布三款 Gemini 新模型并启动 Gemini 4 预训练(2026-07-21,157 条)
- 第 4 集:Gemini 3.6 Flash 评测:更快更省但核心智能未升级(2026-07-22,16 条)
一手来源
- Gemini 3.6 Flash 快两倍便宜 18%,独立测试却没变聪明 — etherd0t ·
- Gemini 3.6 Flash 更快更省,但目标检测退步了 — skalskip92 ·
- Gemini 3.6 Flash 升级明显,但仍落后于两款对手 — haider1 ·
- Gemini 3.6 Flash 浏览器智能体跑分超越 GPT-5.6 — allenainie · 2026-07-22
- 实测 Gemini 3.6 Flash:搜索与落地体验远超同侪 — mertdumenci · 2026-07-22
- Gemini 3.6 Flash 基准更好看,但回归可能挡住升级 — PaiDxng · 2026-07-22
- Gemini 3.6 Flash 在 AA 指数持平 3.5 Flash,DeepSWE 成本降 52% — koltregaskes · 2026-07-22
- Gemini 3.6 Flash 在 AA 指数得分 50,DeepSWE 为 49% — koltregaskes · 2026-07-22
- 用户实测 Gemini 3.6 Flash 只更快,没更聪明 — hero88645 · 2026-07-22
- 报告称 Gemini Flash 持平能力、成本降 30–40% — sujingshen · 2026-07-22
- Gemini 3.6 Flash 被吐槽不如 GPT-5.6 Luna 还贵 2.5 倍 — emax · 2026-07-22
- 【源头】Gemini 3.6 Flash 快两倍便宜 18%,独立测试却没变聪明 — etherd0t · 2026-07-22
- Gemini 3.6 Flash 整体持平,但图表理解掉了 14% — llama_index · 2026-07-22
- Gemini 3.6 Flash 在 WeirdML 仅 56.1%,还常常超时 — scaling01 · 2026-07-23
- 【源头】Gemini 3.6 Flash 更快更省,但目标检测退步了 — skalskip92 · 2026-07-23
- 【源头】Gemini 3.6 Flash 升级明显,但仍落后于两款对手 — haider1 · 2026-07-23
- Gemini 3.6 Flash 在前端代码榜升至第 12 名 — burkov · 2026-07-23
- Gemini 3.6 Flash 速度很快,多模态表现仍在线 — bytebot · 2026-07-23
- Gemini 3.6 Flash 被试后评价:明显更聪明了 — sankin_eth · 2026-07-23