Gemini 3.8 Flash 登顶 DeepSWE 达 74%,但输出 token 用量偏高
haider1 · x · 2026-09-03
- DeepSWE 榜首:Gemini 3.8 Flash 在测试长时程软件工程任务的 DeepSWE 榜单上以 74% 与最顶尖模型并列第一,较 3.7 Flash 的 65% 有明显提升。
- 代价是 token 效率:3.8 Flash 每任务输出约 143k token,3.7 Flash 为 107k,输出 token 用量是上一代的 1.34 倍。
- 横向对比:作者引用称其在 AA Intelligence Index 得 59 分,较 Flash 3.7 大幅跳升,但每任务输出 token 比 GPT-5.6 系列、Opus 5、Fable 5 甚至 Fable 5.1 都更多——智能涨了,token 效率却很粗糙。
所属事件:Gemini 3.8 Flash 影子发布:跑分曝光、定价持平、3.5 Pro 被弃(42 条相关)→
「模型」频道最新
- Google 六周内第三款 Flash:Gemini 3.8 Flash 强化 Agent 与编码 — brianryhuang · 2026-09-03
- 爆料称 Astra 非年度最强,年底还有"怪兽级"新模型待发 — ChrisGPT · 2026-09-03
- 俄罗斯团队创 Mostik:让模型用权重「心电感应」,混合模型登顶 ARC-AGI 3 — nordicinst · 2026-09-03
- Anthropic 上线 Claude 文件检测工具,C2PA 凭证一键验证出处 — btibor91 · 2026-09-03
- Marin 535B A23B 训练公开博客与 wandb 指标入口 — Sentdex · 2026-09-03
- 字节开源 LoopLM:循环潜空间推理让 1.4B 模型比肩 12B 竞品,Bengio 参与 — peterjliu · 2026-09-03