实测:谷歌 Gemini Flash 修复漏洞数少且贵,不敌 OpenAI 平价模型
PawelHuryn · x · 2026-08-25
在针对真实代码库的 Bug 修复基准测试中,Google 最便宜的 Agent 模型 Gemini 3.7 Flash 表现不及 OpenAI 的平价模型 GPT-5.6 Luna。数据显示,Gemini 3.7 Flash 修复了 105 个 Bug 中的 22 个,耗时 96 分钟,成本 8.43 美元;而 GPT-5.6 Luna 修复了 33 个,耗时 86 分钟,成本仅 1.80 美元。作者指出,尽管 Google 宣称 Flash 更快,但其每百万输出 token 价格(3.75 美元)是 Luna(1.20 美元)的三倍,且实际表现更差。
所属事件:实测Gemini Flash修Bug不敌GPT-5.6且贵4.7倍(2 条相关)→
「编程与Agent」频道最新
- VecturaKit 发布:基于 Swift 的端侧向量数据库,支持 MLX 加速 — rudrank · 2026-08-25
- Browser Use CLI 让 Hermes 智能体体验提升 10 倍 — intellectronica · 2026-08-25
- 神经符号系统 SUCCESSOR Ω:生成并演化可执行世界程序 — Ghost_Pilot_MD · 2026-08-25
- 审计 AI 事实核查工具:18 次引用就有 1 次是编造的 — jonathancheckwise · 2026-08-25
- 教程:在树莓派上运行 Hermes Agent — LeviTurk · 2026-08-25
- 反对 Vibe Coding 观点:单人在 2026 年开发 MMO — TAbrodi · 2026-08-25