Gemini 3.7 Flash 修复数输 GPT-5.6,成本却高 4.7 倍

PawelHuryn · x · 2026-08-25

Pawel Huryn 的基准测试显示,Google 最便宜的 agent 模型 Gemini 3.7 Flash 表现不及 OpenAI 的 GPT-5.6 Luna。在 105 个预设 bug 的测试中,Gemini 3.7 Flash 修复了 22 个,耗时 96 分钟,花费 $8.43;而 GPT-5.6 Luna 修复了 33 个,耗时 86 分钟,仅花费 $1.80。Gemini 的成绩低于 Fable 5 和 Grok 4.6 等竞争对手,且价格劣势显著。

所属事件:实测Gemini Flash修Bug不敌GPT-5.6且贵4.7倍(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →