Gemini 3.7 Flash 跑分曝光:性能大涨但指令遵循存短板

谷歌 Gemini 3.7 Flash 模型的多项基准测试与跑分数据近日集中曝光。数据显示,该模型在编码、推理及文本竞技场等评测中较前代大幅提升,并以极低的价格和极高的速度重塑了性价比前沿。然而,多位评测者指出其实际应用中的指令遵循能力依然是明显短板,且在部分测试中存在“过度思考”导致成本飙升的问题。

已确认

尚未确认

为什么重要

Gemini 3.7 Flash 展现了谷歌在中端轻量模型上的激进定价与性能跨越,直接拉高了同类竞品的性价比门槛。但基准跑分与实际指令遵循能力的脱节,也再次引发了开发者对当前评测体系有效性的探讨。

2026-08-13 ~ 2026-08-14 · 14 条相关

事件全程(共 3 集)→

一手来源