Gemini 3.6 Flash 在 WeirdML 仅 56.1%,还常常超时

scaling01 · x · 2026-07-23

WeirdML v2 的最新图表显示,Gemini 3.6 Flash(high)得分只有 56.1%,不仅落后于 Gemini 3.5 Flash,也明显低于前沿模型。

帖子更重要的发现不是分数本身,而是它的失败模式:模型经常把计划做得过于激进,在 120 秒 GPU 限制内超时,而且似乎并不会从这些超时中学到教训。作者称,Flash 3.6 的超时率大约达到 50%,高于 Flash 3.5 的 33%;尽管模型似乎一直意识到时间限制,甚至会在推理中反复提到它,却还是无法把步骤耗时估计准。

配图还展示了 WeirdML v2 的成本、token 和执行时间对照,能看到多个厂商在不同成本区间形成了更分散的帕累托前沿。

所属事件:Gemini 3.6 Flash 跑分与实测:提速降价但未变聪明(9 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →