新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真

airesearch12 · x · 2026-09-11

一条讨论 AI 厂商「benchmaxxing」(围绕公开基准刷分)的帖子:声称 Google 和 Meta 的新模型在常规基准上逼近 OpenAI 和 Anthropic 的顶尖模型(Gemini 89.4%、Muse 88.8%),但一个新基准一发布,分数立刻跌到 19.1% 和 33.3%,而 GPT 与 Fable 系仍稳定在 56-58%。

结论:实验室围绕公开基准优化而非真正提升泛化能力,基准分数正变得越来越不可信。发帖人称已找到量化「刷榜程度」的方法,若有效将发布公开的刷分排行榜。

注意:帖中提到的具体型号(Gemini 3.8 Flash、GPT-6 Astra 等)并非真实存在的已发布模型,内容更像假设性举例或圈讽刺梗,数据本身不可作为事实引用。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →