Gemini 3.6 Flash 跑分曝光:性能停滞但效率翻倍

Artificial Analysis 近日发布了 Google 新模型 Gemini 3.6 Flash 与 3.5 Flash-Lite 的完整基准测试结果。数据显示,新模型在智力得分上并未带来惊喜,但在运行效率与成本控制上实现了显著优化。由于核心性能停滞,外界开始质疑 Google 在大模型竞赛中的研发节奏是否已经落后。

性能表现与竞品对比

根据 Artificial Analysis 的榜单,Gemini 3.6 Flash 获得了 50 分的智力评分,其 Elo 分数达到 1421。但在关键的智力测试中,它的成绩与上一代的 Gemini 3.5 Flash 完全持平。多位网友指出该模型缺乏实质性提升,且在榜单上落后于 Meta Spark 1.1、GPT-5.6 Sol 以及 Grok 4.5 等竞品。此外,对比图表显示 Gemini 3.6 Flash 的使用成本甚至高于 GPT-5.6 Sol medium 和 Grok 4.5,但智能水平反而更低。

效率提升与成本优化

尽管绝对性能未见突破,Gemini 3.6 Flash 在效率上表现亮眼。据 Artificial Analysis 分享的数据,该模型的输出速度达到约 304 token,平均每任务耗时降至前代的一半。同时,单任务成本从 $0.59 降至 $0.50。实测体验也印证了这一点,认为 3.6 Flash 的 Token 效率确实略优于 3.5 版本。不过,Gemini 3.5 Flash-Lite 虽然速度变快,单任务成本却出现了翻倍的情况。

市场评价与争议

面对性能停滞但效率提升的现状,用户评价出现分化。有观点认为,该模型是否值得使用完全取决于实际效率;如果效率不够高,将 GPT-5.6 Sol 的 reasoning effort 调低可能是更好的替代方案。此外,通过整理基准对比表,直观展示了 Gemini 3.6 Flash 在定价、编码及代理任务等维度与 GPT-5.6 Luna、Claude Fable 5、Grok 4.5 等前沿模型的综合差距。

2026-07-21 ~ 2026-07-22 · 19 条相关

事件全程(共 6 集)→