Gemini 3.6 Flash 在 WeirdML 仅 56.1%,还常常超时
scaling01 · x · 2026-07-23
WeirdML v2 的最新图表显示,Gemini 3.6 Flash(high)得分只有 56.1%,不仅落后于 Gemini 3.5 Flash,也明显低于前沿模型。
帖子更重要的发现不是分数本身,而是它的失败模式:模型经常把计划做得过于激进,在 120 秒 GPU 限制内超时,而且似乎并不会从这些超时中学到教训。作者称,Flash 3.6 的超时率大约达到 50%,高于 Flash 3.5 的 33%;尽管模型似乎一直意识到时间限制,甚至会在推理中反复提到它,却还是无法把步骤耗时估计准。
配图还展示了 WeirdML v2 的成本、token 和执行时间对照,能看到多个厂商在不同成本区间形成了更分散的帕累托前沿。
所属事件:Gemini 3.6 Flash 评测:更快更省但未变更聪明(16 条相关)→
「模型」频道最新
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11