审计 162 个大模型跑分差距:仅 20 个能真正区分高下

maverick_man1111 · reddit · 2026-10-09

作者对近两周 Claude、GPT、Gemini、Mistral 发布图表和 9 个排行榜中被引用的 162 个「X 胜 Y」差距做统计审计,对照各 benchmark 自身的采样噪声,结论:

数据、分析和计算器免费公开(draftproofhq.com),可自行输入任意两个分数和样本量验证。核心提醒:无法区分不等于打平,而是该 benchmark 在该规模下无法判别。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →