Gemini 3.8 Flash 等被指严重刷榜:Terminal Bench 2.1 高分 4.0 大跌

max_paperclips · x · 2026-09-08

SemiAnalysis 发推称 Gemini 3.8 Flash 与 Muse Spark 1.3 是目前「刷榜最明显」的模型:两者在 Terminal Bench 2.1 上与 GPT-6、Fable 5.1 相当,但在 Terminal Bench 4.0 上成绩显著落后。

NielsRogge 转发并指出,Astra 与 Fable 5.1 从 2.1 到 4.0 的糟糕泛化说明业界「基本是在测试集上训练」——如果新基准最终只是变成 RL 训练环境,新基准的意义何在?

所属事件:Gemini 3.8 Flash 等模型被 SemiAnalysis 指刷榜(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →