审计 162 个大模型跑分差距:仅 20 个能真正区分高下
maverick_man1111 · reddit · 2026-10-09
作者对近两周 Claude、GPT、Gemini、Mistral 发布图表和 9 个排行榜中被引用的 162 个「X 胜 Y」差距做统计审计,对照各 benchmark 自身的采样噪声,结论:
- 仅 20 个差距能干净地与噪声区分,其余 142 个并非造假,而是无法在现有数据下验证或本就未定
- 6 篇前沿发布帖引用的 44 个对比中:11 个可区分,5 个不可,28 个用公开数据无法诚实检验;Gemini 4 Argon 有 15 个、Mistral Large 4 有 9 个此类对比,24 个全部无法核验
- 9 个排行榜视图的 118 对相邻排名中仅 9 对可区分。典型如 SWE-bench Multilingual:72.7% vs 66.3% 的 6.4 分领先看似悬殊,但仅 300 道题,不确定区间包含零;榜首位置有 6 名模型无法与第一名区分
- 作者用 Claude Code 构建了分析管线,还对自己做了审计,推翻了自己首轮 5 个「可区分」判断,最终定为 20
数据、分析和计算器免费公开(draftproofhq.com),可自行输入任意两个分数和样本量验证。核心提醒:无法区分不等于打平,而是该 benchmark 在该规模下无法判别。
「模型」频道最新
- Ai2 高管回应质疑:下一代 Olmo 模型已在训练,全面开源路线不变 — sewon__min · 2026-10-09
- 16.9MB 端侧语音识别模型 Whistle 开源:11ms 出首 token 支持 7 种语言 — solyarisoftware · 2026-10-09
- Nous Research 误发「Hemres Agnet」,或预告 Hermes Agent 到来 — Teknium · 2026-10-09
- 研究:过期版 Gemini 问诊建议获医生评同医生相当且无安全问题 — emollick · 2026-10-09
- Scott Aaronson:AI 惊奇与恐怖的时代已经到来,怀疑论该醒了 — scottleibrand · 2026-10-09
- 前多模态研究员:模型「品味」对齐为何永远无法让所有人满意 — A_K_Nain · 2026-10-09