Gemini 3.6 Flash 评测:更快更省但核心智能未升级

Google 最新发布的 Gemini 3.6 Flash 引发了社区的广泛实测与讨论。该模型在效率上实现了显著跃升,速度提升约两倍,价格下调 18%,且 token 消耗有所减少。然而,独立评测普遍指出其核心智能水平并未随之升级,整体表现与上代持平,在部分能力上甚至出现退步,引发了关于其性价比和升级价值的质疑。

已确认

在整体智能评估上,多位作者指出 Gemini 3.6 Flash 在 Artificial Analysis (AA) 指数上得分 50,与前代完全持平。@haider1 与 @emax 等人强调,尽管新模型在编程榜单(如 DeepSWE 得分从 37% 升至 49%)有所进步,但整体表现仍落后于 GPT-5.6 Sol、Terra 等竞品,且在对比中被指比 GPT-5.6 Luna 贵出 2.5 倍。@skalskip92 与 @llama_index 的测试发现模型在目标检测和图表理解(ParseBench 掉点 14%)上出现明显退步,@scaling01 也指出其在 WeirdML 测试中常因计划过于复杂而导致超时。在特定应用场景中,该模型展现了强劲实力:@allenainie 提到其在 browser_use 的 Web 智能体任务测试中取得 68% 的高分,超越 GPT-5.6-sol 与 Sonnet 4.6;@mertdumenci 高度评价了其在搜索型任务中的落地体验;@bytebot 也证实其多模态能力依然保持在线,且网页端使用速度极快。

尚未确认

关于该模型是否在主观体验上变得更聪明,社区反馈存在分歧。@sankin_eth 在简单试用后认为模型“明显更聪明了”,但这属于个体主观感受,与多数基准测试得出的“智能持平”结论存在差异。

为什么重要

该模型的发布策略反映了 Google 的路线调整。@PaiDxng 认为 Google 试图通过更好的官方基准数字和 token 优化来推动用户升级,但回归测试的结果可能会阻碍这一进程。@sujingshen 分享的第三方报告指出,Google 正在将策略转向在持平能力下降低 30-40% 的成本。然而,@burkov 直言,基于前端代码竞技场(Frontend Code Arena)等榜单的数据,Google 目前已在顶级模型竞争中落后于至少 6 家实验室。整体而言,Gemini 3.6 Flash 是一次侧重于效率与特定智能体能力的迭代,而非基础智能的飞跃。

2026-07-22 ~ 2026-07-23 · 16 条相关

事件全程(共 4 集)→

一手来源