Gemini 3.7 Flash 发布:智能体评测大幅提升,速度与成本登顶帕累托前沿
ArtificialAnlys · x · 2026-08-14
Google DeepMind 发布了三个月内的第三个 Flash 模型——Gemini 3.7 Flash。据 Artificial Analysis 评测,该模型在智能体能力、速度和成本效益上均取得显著进步。
核心评测数据
- 智能指数提升:在高推理模式下得分为 56,较前代提升 4 分,仅次于 GPT-5.6 Terra (57) 和 Muse Spark 1.2 (57)。提升主要来自智能体评测,如 Tau3 Banking、Terminal-Bench 和 GDPval-AA v2。
- 速度与时间:输出速度达约 340 tokens/秒,是 GPT-5.6 Terra 的近 3 倍。平均任务耗时 1.7 分钟,成功跻身“智能与时间”帕累托前沿。
- 成本大幅下降:年底前提供 $0.75/$3.75(每百万输入/输出 token)的折扣价。在高推理模式下,单任务成本降至 $0.40,比前代低 30%,处于“智能与成本”帕累托前沿。
- 专项基准领先:在针对电子表格和文档复杂问题的 AA-AnalystAgent 基准中以 60% 的得分登顶;在模拟 SaaS 环境的 AutomationBench-AA 中得分 62.7%,超越 Kimi K3 和 GPT-5.6 Sol。
模型规格
- 上下文窗口:100 万 tokens。
- 多模态:支持文本、图像、视频和语音输入,文本输出。
所属事件:谷歌发布 Gemini 3.7 Flash:编码与智能体能力大幅提升且半价(32 条相关)→
「模型」频道最新
- 实测 DeepSeek v4 Pro 辅助 CAD 参数化建模 — jakedahn · 2026-08-14
- 曝 Gemini 3.7 Flash 编码评测大涨,智商超 Sonnet 5 且价格极低 — ChrisGPT · 2026-08-14
- 告别查手册:1.5B微调模型秒出Shell命令,旧笔记本也能跑 — PicassoOnPause · 2026-08-14
- 缺乏主见?Sol 和 Fable 模型互相看一眼答案就变卦 — john__allard · 2026-08-14
- Grok 4.6 实测:速度占优,但远未达 Opus 级别 — bindureddy · 2026-08-14
- Grok登顶罕见病诊断榜首,DeepSeek与GLM新模型表现不及预期 — ns123abc · 2026-08-14