跑分涨了实战崩了:新基准让各家模型成绩从 89% 跌到 19%
Able-Line2683 · reddit · 2026-09-08
一张吐槽「benchmaxxing」(刷榜式优化)的梗图:表面上看各家模型表现接近,但一出现新基准,成绩瞬间崩盘——某模型从 89.4% 跌到 19.1%,另一个从 88.8% 跌到 33.3%。讽刺模型在高分基准上的能力可能是过拟合,换一套测试就现出原形。(图中模型版本名为虚构/恶搞,但传达的刷榜批评是社区普遍观点。)
「Fun」频道最新
- Reddit 网友发图「我们已经把 agent 关进沙箱了」玩梗 agent 逃逸 — Confident_Salt_8108 · 2026-09-08
- Actian 新向量库自称比 Qdrant 快 22 倍,文档概念却与 Qdrant 如出一辙 — qdrant_engine · 2026-09-08
- 开发者抓取 1 亿张儿童画作建搜索引擎,二十年趋势一览无余 — luismbat · 2026-09-08
- 网友质疑 OpenAI 疑似抄袭 Anthropic 员工言论,暗讽 Phi 团队前负责人 — teortaxesTex · 2026-09-08
- X Creator Studio 的 Inspiration 标签被吐槽满是「人类垃圾内容」 — davidpattersonx · 2026-09-08
- AirPods 发布十周年:从群嘲到人人爱用的反转 — Dan_Jeffries1 · 2026-09-08