新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真
airesearch12 · x · 2026-09-11
一条讨论 AI 厂商「benchmaxxing」(围绕公开基准刷分)的帖子:声称 Google 和 Meta 的新模型在常规基准上逼近 OpenAI 和 Anthropic 的顶尖模型(Gemini 89.4%、Muse 88.8%),但一个新基准一发布,分数立刻跌到 19.1% 和 33.3%,而 GPT 与 Fable 系仍稳定在 56-58%。
结论:实验室围绕公开基准优化而非真正提升泛化能力,基准分数正变得越来越不可信。发帖人称已找到量化「刷榜程度」的方法,若有效将发布公开的刷分排行榜。
注意:帖中提到的具体型号(Gemini 3.8 Flash、GPT-6 Astra 等)并非真实存在的已发布模型,内容更像假设性举例或圈讽刺梗,数据本身不可作为事实引用。
「模型」频道最新
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- Anthropic 发布迄今最详尽威胁情报报告:无人机蜂群滥用案例曝光 — soumitrashukla9 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11