Gemini 3.8 Flash 曝光:DeepSWE 1.1 拿 73.7% 逼近旗舰
9 月 2 日至 3 日,Google 的 Logan Kilpatrick 分享了新模型 Gemini 3.8 Flash 在编程/Agent 基准 DeepSWE 1.1 上的成绩:73.7%,随后多位用户在社交平台转述并补充对比数据,引发关注。目前 Google 官方尚未正式发布确认。
已确认
- Logan Kilpatrick(Google)公布了 Gemini 3.8 Flash 在 DeepSWE 1.1 上的成绩 73.7%,并附评测链接(m1、m5)。
- @cedricchee 补充对比数据:Gemini 3.8 Flash 得 73.7%,Fable 5.1 为 67.4%,领先约六个百分点(m4)。
- @cedricchee 还列出 Gemini 3.8 Flash(high)pass@1 达 73.7%,与旗舰模型几乎持平:Opus 5(max)为 74.0%(pass@1),并提到 GPT-5.6 等模型(帖子原文被截断,完整对比数据需查看原帖)(m6)。
尚未确认
- @vedantmisra 提醒,该消息目前主要是第三方转述与截图,Google 官方尚未正式发布确认,评测细节需点开原链接核实(m2)。
- @ChrisGPT 称 Gemini 3.8 Flash 已推出,并提到 Terminal-Bench 2.1 得 89.4%,但他本人也指出该榜单已过时(现已到 Terminal-Bench 4),此发布消息未经官方证实(m3)。
为什么重要
- 若成绩属实,Flash 级模型在自主软件工程任务上已逼近甚至追平旗舰模型,性价比意义明显。
- @doodlestein 表示期待:3.7 Flash 已经不错,3.8 Flash 进一步提升更值得观望(m5)。
2026-09-02 ~ 2026-09-03 · 7 条相关
一手来源
- Gemini 3.8 Flash 在 DeepSWE 1.1 基准拿下 73.7% — OfficialLoganK ·
- Gemini 3.8 Flash 跑 DeepSWE 得 73.7%,领先 Fable 5.1 六个百分点 — cedric_chee ·
- Gemini 3.8 Flash 跑分曝光:DeepSWE 73.7% 逼近 Opus 5 — cedric_chee ·
- 【源头】Gemini 3.8 Flash 在 DeepSWE 1.1 基准拿下 73.7% — OfficialLoganK · 2026-09-02
- 【源头】Gemini 3.8 Flash 跑 DeepSWE 得 73.7%,领先 Fable 5.1 六个百分点 — cedric_chee · 2026-09-03
- 【源头】Gemini 3.8 Flash 跑分曝光:DeepSWE 73.7% 逼近 Opus 5 — cedric_chee · 2026-09-03
- Gemini 3.8 Flash 曝光:DeepSWE 1.1 得分 73.7% — doodlestein · 2026-09-03
- 网传 Gemini 3.8 Flash 登顶 DeepSWE v1.1 基准,真实性待证 — vedantmisra · 2026-09-03
- 传 Gemini 3.8 Flash 发布:Terminal-Bench 2.1 得 89.4%,DeepSWE 得 73.7% — ChrisGPT · 2026-09-03
- Gemini 3.8 Flash 登顶 DeepSWE 达 74%,但输出 token 用量偏高 — haider1 · 2026-09-03