Gemini 3.6 Flash 跑分出炉:提速降本与实测体验

Google 的 Gemini 3.6 Flash 基准测试与初期实测反馈于 7 月 22 日集中曝光。这款模型在核心跑分上并未展现出跨代式的智能飞跃,但通过显著的成本压缩和速度提升,以及在特定场景下的优异表现,引发了社区的广泛关注与讨论。

关键细节与跑分表现

在 Artificial Analysis Intelligence Index 上,Gemini 3.6 Flash 拿到 50 分,与上一代 3.5 Flash 持平。但在长程软件工程(DeepSWE)榜单中,它取得了 49% 的成绩,明显高于 3.5 Flash 的 37%。此外,该模型据称比前代少用 17% 的输出 token,且在 DeepSWE 上的成本大幅降低了 52%。

争议与实测反馈

关于其实际能力,用户反馈存在明显分歧。Reddit 网友指出,由于 AA 指数得分没变,模型的核心变化仅仅是“更快、更便宜”,并没有变得更聪明,甚至这种提速可能会挡住真正的升级。然而,开发者 @mertdumenci 给出了截然不同的正面评价,他认为 Gemini 3.6 Flash 在处理“搜索型任务”时响应表现极佳,实际落地体验远超 GPT 或 Claude 系列。

2026-07-22 ~ 2026-07-22 · 5 条相关

事件全程(共 6 集)→