实测Gemini Flash修Bug不敌GPT-5.6且贵4.7倍

Pawel Huryn 针对真实代码库的 Bug 修复基准测试显示,谷歌最便宜的 Agent 模型 Gemini 3.7 Flash 表现不及 OpenAI 平价模型 GPT-5.6 Luna,修复的漏洞数量更少,而成本却高出约 4.7 倍。在 105 项测试等具体数据下,谷歌低成本模型在性价比上明显落败,引发对两家模型代理能力与定价差距的讨论。

2026-08-25 ~ 2026-08-25 · 2 条相关