Gemini 3.8 Flash 评测:性价比登顶 Pareto 前沿
Artificial Analysis 于 09-02 发布 Google 四个月内第四款 Flash 模型 Gemini 3.8 Flash 的完整评测,涵盖智能指数、AA-Briefcase、agent 与编程评测、速度与成本等维度,并同步公布高/中/低三档推理的完整基准成绩。总体结论是:智能显著提升、输出更多但单价上涨,综合仍落在性价比 Pareto 前沿,是同智能水平下成本最低的选择。用户 @haider1 亦观察到智能指数大幅提升的同时单任务 token 消耗偏高,与官方数据一致。
已确认
- 智能指数:高推理档得分 59,较 3.7 Flash 的 56 提升 3 分,在 195 个模型中排第 16(中位数 36),与 sub-max 模型持平
- Agent 能力:旗舰 agent 知识工作评测 AA-Briefcase 得分 Elo 1213,较 3.7 Flash 的 1134 提升 79 分,该评测基于数千个复杂输入
- 速度与效率:高推理档平均输出约 300 token/秒(评测页记为 305 token/秒),单任务耗时 2.5 分钟,略优于 GPT-5.6 Luna(2.6 分钟)
- 输出量:平均每任务输出约 48k token,较 3.7 Flash 多 30%,单任务耗时从 2.2 分钟升至 2.5 分钟
- 成本:高推理档每个 Intelligence Index 任务成本 $0.58,是同智能水平下测得最便宜的,但比 3.7 Flash 贵约 40%,主因是输出 token 增多
为什么重要
- 该模型登上 Artificial Analysis 的性价比 Pareto 前沿,说明在同等智能水平下为目前成本最低的选择,对成本敏感的 agent/知识工作负载具有直接参考价值
- 输出量增加 30% 带来耗时与成本上升,体现新一代模型"更长思考、更强表现"的取向,选型时需权衡智能增益与单价上涨
- Google 在四个月内连推四款 Flash 模型,中端模型迭代速度明显加快
2026-09-02 ~ 2026-09-03 · 9 条相关
一手来源
- Gemini 3.8 Flash 登性价比 Pareto 前沿,单任务成本 $0.58 — ArtificialAnlys ·
- Artificial Analysis 公布 Gemini 3.8 Flash 三档推理完整基准成绩 — ArtificialAnlys ·
- Gemini 3.8 Flash 完整评测:智能第16名,每秒305 token — ArtificialAnlys ·
- 【源头】Gemini 3.8 Flash 登性价比 Pareto 前沿,单任务成本 $0.58 — ArtificialAnlys · 2026-09-02
- Gemini 3.8 Flash 单任务成本 $0.58,同级智能中最便宜 — ArtificialAnlys · 2026-09-02
- Gemini 3.8 Flash 实测:每秒输出约300 token,任务耗时2.5分钟 — ArtificialAnlys · 2026-09-02
- Gemini 3.8 Flash 单任务输出 48k token,较上代多 30% — ArtificialAnlys · 2026-09-02
- Gemini 3.8 Flash AA-Briefcase Elo 达 1213,较上代涨 79 分 — ArtificialAnlys · 2026-09-02
- 【源头】Artificial Analysis 公布 Gemini 3.8 Flash 三档推理完整基准成绩 — ArtificialAnlys · 2026-09-02
- 【源头】Gemini 3.8 Flash 完整评测:智能第16名,每秒305 token — ArtificialAnlys · 2026-09-02
- Gemini 3.8 Flash 智能指数达 59 分,但单任务 token 消耗偏高 — haider1 · 2026-09-03
- Gemini 3.8 Flash 评测涨 3 分至 59,逼近开源前沿 60 分线 — cedric_chee · 2026-09-03