Gemini 3.6 Flash 在 WeirdML 仅 56.1%,还常常超时
scaling01 · x · 2026-07-23
WeirdML v2 的最新图表显示,Gemini 3.6 Flash(high)得分只有 56.1%,不仅落后于 Gemini 3.5 Flash,也明显低于前沿模型。
帖子更重要的发现不是分数本身,而是它的失败模式:模型经常把计划做得过于激进,在 120 秒 GPU 限制内超时,而且似乎并不会从这些超时中学到教训。作者称,Flash 3.6 的超时率大约达到 50%,高于 Flash 3.5 的 33%;尽管模型似乎一直意识到时间限制,甚至会在推理中反复提到它,却还是无法把步骤耗时估计准。
配图还展示了 WeirdML v2 的成本、token 和执行时间对照,能看到多个厂商在不同成本区间形成了更分散的帕累托前沿。
所属事件:Gemini 3.6 Flash 跑分与实测:提速降价但未变聪明(9 条相关)→
「模型」频道最新
- 写作指纹分析称 Kimi K3 与 Fable 5 过于相似 — alex_verem · 2026-07-23
- Cisco 称两款开源安全小模型在漏洞检测上更省钱 — The Decoder · 2026-07-23
- Laguna-S-2.1 败在 100 米步行决策测试 — logic_prevails · 2026-07-23
- BTL-3 以 8.39GB 文件发布 27B 开源 agent 模型 — QuixiAI · 2026-07-23
- Claude Opus 4.8 占 OpenRouter 上 Anthropic 用量 40% — maferase · 2026-07-23
- GLM 复现 cmatrix 几乎满分,只差“Computer locked.” — jyangballin · 2026-07-23