105 个真实 bug 实测:Gemini 3.8 Flash 花 $9.78 修 20 个,进步明显
PawelHuryn · x · 2026-09-03
作者在 Antigravity CLI 上用两个真实代码仓库、共 105 个隐藏 bug 横测了 Gemini 3.8 Flash (high) 与其他旗舰模型:
- Fable 5.1 (max):43/105,花费 $77.55
- GPT-5.6 (max):42/105,$69.61
- Grok 4.6 (xhigh):27/105,$16.96
- Opus 5 (max):21/105,$51.33
- Gemini 3.8 Flash (high):20/105,$9.78
Gemini 3.8 Flash 虽未登顶,但相比 3.6 Flash 的 16-20/105 有明显跃升,且性价比突出($9.78 最低)。作者还指出一个关键事实:仍有 43/105 个 bug 没有任何模型能修复。
所属事件:105 个隐藏 bug 实测各模型找错能力(2 条相关)→
「编程与Agent」频道最新
- 开发者发问:现在还该用 LangChain 还是自建 agent 框架? — curious_vii · 2026-09-03
- 推理工程吃香:vLLM/SGLang 搭副本加缓存路由核心配方 — GabGarrett · 2026-09-03
- 开发者误打误撞用 Fable 5.1 搭出一座「智能体工厂」 — 0xkarasy · 2026-09-03
- 微软新法:Foundry 智能体可经 Fabric IQ 调用 Fabric 数据智能体 — adnan_hashmi · 2026-09-03
- Databricks 在 VLDB 2026 主推 agent 原生数据基础设施 Lakebase — matei_zaharia · 2026-09-03
- doodlestein 沉淀数月经验,发布 Web 应用综合审查 Skill — doodlestein · 2026-09-03