实测Gemini Flash修Bug不敌GPT-5.6且贵4.7倍
Pawel Huryn 针对真实代码库的 Bug 修复基准测试显示,谷歌最便宜的 Agent 模型 Gemini 3.7 Flash 表现不及 OpenAI 平价模型 GPT-5.6 Luna,修复的漏洞数量更少,而成本却高出约 4.7 倍。在 105 项测试等具体数据下,谷歌低成本模型在性价比上明显落败,引发对两家模型代理能力与定价差距的讨论。
2026-08-25 ~ 2026-08-25 · 2 条相关
- 实测:谷歌 Gemini Flash 修复漏洞数少且贵,不敌 OpenAI 平价模型 — PawelHuryn · 2026-08-25
- Gemini 3.7 Flash 修复数输 GPT-5.6,成本却高 4.7 倍 — PawelHuryn · 2026-08-25