专题 · FULL STORY

Gemini 3.7 Flash:从跑分泄露到降价发布

谷歌Gemini 3.7 Flash模型近日经历跑分曝光与后台泄露,引发广泛关注。8月14日官方正式发布该模型,其定价大幅减半,主打编码与智能体工作流优化,性能实现显著跃升。

2026-08-13 ~ 2026-08-14 · 3 集 · 65 条

第 1 集 · Gemini 3.7 Flash跑分曝光:性能跃升,指令遵循仍短板(2026-08-13,15 条)

谷歌 Gemini 3.7 Flash 模型的基准测试与跑分数据近日集中曝光。数据显示,该模型在编码、推理及文本竞技场等评测中较前代大幅提升,并以极低的价格和极高的速度重塑了性价比前沿。然而,多位评测者指出其实际应用中的指令遵循能力依然是明显短板,且在部分测试中存在“过度思考”导致成本飙升的问题。

已确认

  • 竞技场成绩:据 LMSYS 数据,Gemini 3.7 Flash (High) 在文本竞技场取得 1490 分位列第 9,较前代 3.6 Flash 的第 16 名显著提升;在 Code Arena: WebDev 中获得 1588 分登顶。
  • 基准测试提升:OSWorld 得分从 33.8% 跃升至 47.9%;FrontierCode 基准从 34.4% 升至 43.6%;知识工作推理(GDP.pdf 基准)从 22% 升至 34%。
  • 智能与性价比:在 Artificial Analysis 智能指数中得分为 56(同类中位数为 34),在同时要求“最快速度”与“最高智力”的推荐测试中登顶。作者 @petrusenkomax 确认其成本较前代减半。
  • 未达最优项:在 VoxelBench 评测中位列第七;开发者 Zachary Nado 指出其在 BenchBench 评测上未达 SOTA(当前最优)水平。

尚未确认

  • 实际体验争议:作者 @bindureddy 评测指出其得分略低于 Kimi K3,且指令遵循能力依然薄弱,导致实际应用体验不佳。作者 @teortaxesTex 则批评该模型存在“过度思考”问题,在某些用例中性能不及 Pro 版本,且使用成本高达 Pro 的 4.5 倍,性价比不佳。

为什么重要

Gemini 3.7 Flash 展现了谷歌在中端轻量模型上的激进定价与性能跨越,直接拉高了同类竞品的性价比门槛。但基准跑分与实际指令遵循能力的脱节,也再次引发了开发者对当前评测体系有效性的探讨。

第 2 集 · Gemini 3.7 Flash 后台泄露将发布,定价减半且 Pro 版或遭弃用(2026-08-13,9 条)

谷歌 Gemini 3.7 Flash 模型已在多个后台现身,爆料称即将发布,且定价较前代大幅减半。同时,内部传闻称 Gemini 3.5 Pro 已被弃用,真正的旗舰 Pro 版本可能要等到 4.0 才会推出。这表明谷歌正在调整其模型迭代与定价策略,以应对激烈的市场竞争。

已确认

  • 据 @RareBunch4348 和 @testingcatalog 爆料,Gemini 3.7 Flash 已出现在 Google Cloud Console 和 Gemini Enterprise 后台中,模型 ID 为 gemini-3.7-flash,目前处于隐藏状态,暗示发布在即。
  • 多位爆料者(@adonissingh, @rickasaurus, @tulseedoshi)指出,新模型定价较上一代 3.6 Flash 直接减半:输入价格为 $0.75/百万 tokens,输出价格为 $3.75/百万 tokens。

尚未确认

  • @adonissingh 透露 Gemini 3.5 Pro 已被内部弃用,但未提供更多细节。
  • @koltregaskes 推测,真正的旗舰 Pro 版本可能要等到 Gemini 4.0 才会推出。
  • @RareBunch4348 对谷歌迟迟不发布旗舰款 Pro 模型(此前承诺于6月发布)表示不满,这也侧面印证了 Pro 版本进度可能不及预期。
  • @haider1 猜测,谷歌可能通过蒸馏的方式将 Pro 级的能力分散到 Flash 3.5、3.6 和 3.7 中逐步释放,以此规避前沿基准测试的压力。

为什么重要

Gemini 3.7 Flash 以减半的定价发布,将显著降低开发者的使用成本,加剧 AI 模型市场的价格战。同时,3.5 Pro 的弃用和 Pro 版推迟的传闻,反映出谷歌产品线规划的变动,可能影响用户对谷歌旗舰模型迭代节奏的预期与信任。

第 3 集 · Google发布Gemini 3.7 Flash大降50%(2026-08-14,41 条)

谷歌于8月14日正式发布Gemini 3.7 Flash模型,这是一款专为编码和智能体工作流优化的“主力工作马”模型。官方及评测数据显示,该模型在软件工程和复杂任务处理上实现了显著飞跃,同时以减半的优惠价格向开发者开放,引发业界广泛关注。

已确认

  • 核心性能升级:官方数据显示,模型软件工程能力(DeepSWE v1.1)从49.0%升至65.3%,FrontierCode从34.4%升至43.6%。此外,在调试、UI设计、网页开发、游戏制作及PDF理解等方面均有大幅提升。
  • 定价与可用性:年底前API调用价格比上一代3.6 Flash便宜50%。目前已上线API、AI Studio及Antigravity平台,并接入Google AI Pro和Ultra订阅服务,同时开始集成至GitHub Copilot。
  • 智能体表现与演示:开发者@philschmid实测指出,新模型在智能体工作流中更具纪律性,会先探索、解析错误并运行测试,最后才修改代码,减少了无效轮次。Google团队还演示了3个智能体完全自主从零训练机器人控制模型,展示其复杂自动化能力。

为什么重要

  • 极速的迭代速度:据@koraykv和@mitsuhiko透露,该模型在3个月内从3.5迭代至3.7,距3.6发布仅约三周。这得益于算法层面的优化和开发者反馈,证明了谷歌在模型快速演进上的强大工程能力。
  • 重塑性价比标准:在保持极高运行速度的同时大幅降价,使其在当前的大模型竞争中具备极强的成本效益,进一步降低了企业级应用与复杂智能体开发的门槛。

还有 21 条相关讨论 →