Gemini 3.8 Flash 跑分曝光:DeepSWE 73.7% 逼近 Opus 5
cedric_chee · x · 2026-09-03
有用户晒出 Gemini 3.8 Flash(high)在 DeepSWE 编程基准上的成绩:pass@1 达 73.7%,与几款旗舰模型几乎持平:
- Opus 5(max):74.0%(pass@1)
- GPT-5.6 Sol(max):73%(pass@1)
- Fable 5.1:67.4%(pass@5)
若数据属实,意味着 Google 的 Flash 级轻量模型在编程任务上已能对标其他家的旗舰型号,性价比优势明显(成绩为第三方转述,未经官方证实)。
所属事件:Gemini 3.8 Flash 影子发布:跑分曝光、定价持平、3.5 Pro 被弃(42 条相关)→
「模型」频道最新
- Google 六周内第三款 Flash:Gemini 3.8 Flash 强化 Agent 与编码 — brianryhuang · 2026-09-03
- 爆料称 Astra 非年度最强,年底还有"怪兽级"新模型待发 — ChrisGPT · 2026-09-03
- 俄罗斯团队创 Mostik:让模型用权重「心电感应」,混合模型登顶 ARC-AGI 3 — nordicinst · 2026-09-03
- Anthropic 上线 Claude 文件检测工具,C2PA 凭证一键验证出处 — btibor91 · 2026-09-03
- Marin 535B A23B 训练公开博客与 wandb 指标入口 — Sentdex · 2026-09-03
- 字节开源 LoopLM:循环潜空间推理让 1.4B 模型比肩 12B 竞品,Bengio 参与 — peterjliu · 2026-09-03