Gemini 3.6 Flash 在 AA 指数持平 3.5 Flash,DeepSWE 成本降 52%
koltregaskes · x · 2026-07-22
Gemini 3.6 Flash 在两个榜单上的表现一起被放了出来:编程能力有进步,但整体仍处于中上游。
- 在 DeepSWE(长程软件工程) 上,它拿到 49%,比 3.5 Flash 的 37% 明显提升;平均每任务成本从 $7.34 降到 $3.53,输出 token 从 276k 降到 97k。
- 同组对比里,Claude Opus 4.8 medium 也是 49%($3.44),GPT-5.6 Sol low 是 45%($1.07),Claude Sonnet 5 high 是 48%($7.43)。
- 在 Artificial Analysis Intelligence Index 上,3.6 Flash 得分 50,与 3.5 Flash 持平,但速度达到 280 tokens/sec,定价也更便宜($1.50 in / $7.50 out,比 3.5 Flash 便宜 17%)。
- 图里的总榜显示,它低于 GPT-5.6 Luna max(51)、GLM-5.2 max(51) 和 Claude Sonnet 5 max(53)。
所属事件:Gemini 3.6 Flash 跑分出炉:提速降本与实测体验(5 条相关)→
「模型」频道最新
- 小红书大模型 IMO 官方评卷拿下 42/42 满分 — xiaohu · 2026-07-22
- 前沿大厂死磕 AGI,专用 AI 与小模型靠成本与速度破局 — bendee983 · 2026-07-22
- Grok 4.5 被夸写作更清晰直接,还讲虚拟内存更顺 — elonmusk · 2026-07-22
- OpenAI、Anthropic、Google 份额降至 83.29%,Moonshot 一周涨 8.4 倍 — teortaxesTex · 2026-07-22
- 前沿 LLM 1.6 年合成交易回测全亏了钱 — Scobleizer · 2026-07-22
- Reddit 用户称可用模板改动强制 Laguna-S-2.1 更长思考 — SnooPaintings8639 · 2026-07-22