Gemini 3.8 Flash 等被指严重刷榜:Terminal Bench 2.1 高分 4.0 大跌
max_paperclips · x · 2026-09-08
SemiAnalysis 发推称 Gemini 3.8 Flash 与 Muse Spark 1.3 是目前「刷榜最明显」的模型:两者在 Terminal Bench 2.1 上与 GPT-6、Fable 5.1 相当,但在 Terminal Bench 4.0 上成绩显著落后。
NielsRogge 转发并指出,Astra 与 Fable 5.1 从 2.1 到 4.0 的糟糕泛化说明业界「基本是在测试集上训练」——如果新基准最终只是变成 RL 训练环境,新基准的意义何在?
所属事件:Gemini 3.8 Flash 等模型被 SemiAnalysis 指刷榜(3 条相关)→
「模型」频道最新
- OpenAI 称 Astra 达 Critical 网络安全阈值,且比上代更难监控 — theguywhobuilds · 2026-09-11
- TestingCatalog 日报改版:周二至周六新增邮件订阅 — testingcatalog · 2026-09-11
- Similarweb:ChatGPT 月活破 10.6 亿,连续 4 个月创新高 — FinanceYF5 · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11