Gemini 3.7 Flash 修复数输 GPT-5.6,成本却高 4.7 倍
PawelHuryn · x · 2026-08-25
Pawel Huryn 的基准测试显示,Google 最便宜的 agent 模型 Gemini 3.7 Flash 表现不及 OpenAI 的 GPT-5.6 Luna。在 105 个预设 bug 的测试中,Gemini 3.7 Flash 修复了 22 个,耗时 96 分钟,花费 $8.43;而 GPT-5.6 Luna 修复了 33 个,耗时 86 分钟,仅花费 $1.80。Gemini 的成绩低于 Fable 5 和 Grok 4.6 等竞争对手,且价格劣势显著。
所属事件:实测Gemini Flash修Bug不敌GPT-5.6且贵4.7倍(2 条相关)→
「模型」频道最新
- Shopify 高管实测:Liquid AI 模型帕累托最优,击败更大竞品 — JosephJacks_ · 2026-08-25
- 高性价比模型引热议:智能已廉价至免费? — haider1 · 2026-08-25
- GPT-5.4 惊人特性:一个变音符号改变输出率 47% — rayanpal_ · 2026-08-25
- 斯坦福研究揭示:LLM 并不具备真实情感 — LuizaJarovsky · 2026-08-25
- Grok Build 30美元月付用一天半即触发限额,一停就是一整周 — burkov · 2026-08-25
- Grok 自发生成图片推送,被指游击式用户促活 — StefanoGogioso · 2026-08-25