Gemini 3.6 Flash 在 AA 指数持平 3.5 Flash,DeepSWE 成本降 52%
koltregaskes · x · 2026-07-22
Gemini 3.6 Flash 在两个榜单上的表现一起被放了出来:编程能力有进步,但整体仍处于中上游。
- 在 DeepSWE(长程软件工程) 上,它拿到 49%,比 3.5 Flash 的 37% 明显提升;平均每任务成本从 $7.34 降到 $3.53,输出 token 从 276k 降到 97k。
- 同组对比里,Claude Opus 4.8 medium 也是 49%($3.44),GPT-5.6 Sol low 是 45%($1.07),Claude Sonnet 5 high 是 48%($7.43)。
- 在 Artificial Analysis Intelligence Index 上,3.6 Flash 得分 50,与 3.5 Flash 持平,但速度达到 280 tokens/sec,定价也更便宜($1.50 in / $7.50 out,比 3.5 Flash 便宜 17%)。
- 图里的总榜显示,它低于 GPT-5.6 Luna max(51)、GLM-5.2 max(51) 和 Claude Sonnet 5 max(53)。
所属事件:Gemini 3.6 Flash 评测:更快更省但未变更聪明(16 条相关)→
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11