Gemini 3.8 Flash 登场:DeepSWE 得分 73.7%,成本持平
burny_tech · x · 2026-09-06
据 datacurve 引用的测试结果,Gemini 3.8 Flash 在 DeepSWE 基准上取得 73.7% 的成绩,较 Gemini 3.7 Flash 提升 8.2 个百分点。
- 成本保持不变,但使用了更多步数和输出 token
- 也就是说涨分部分来自“更贵的用量、单价不变”的换算
- 目前为第三方 benchmark 报告,厂商官方尚未详细发布
「模型」频道最新
- 程序员戏称 Codex 里的 GPT-10 Astra 为 Astral Codex Ten — jam3scampbell · 2026-09-06
- 开发者实测 GPT-6 Astra 一天:重构代码更聪明,编码几乎无需换模型 — ivan_bezdomny · 2026-09-06
- Armin Ronacher:多数模型的推理档位写在系统提示里,切换即废 KV 缓存 — mitsuhiko · 2026-09-06
- GPT-6 Astra 攻克 LaTeX 图表难关,6 个月才刷满该基准 — FateOfMuffins · 2026-09-06
- GPT-6 Astra 发布:Epoch 指数 169 破纪录,但推理过程更难被监督 — ivan_bezdomny · 2026-09-06
- OpenAI 修复 Codex 无限用量漏洞,用户 8 小时烧掉 30-40 倍额度 — returnity · 2026-09-06