研究:56 个 AI 基准×53 个模型,多项基准测不出宣称的能力

sanmikoyejo · x · 2026-09-29

一项大规模研究借鉴社会科学中的聚合效度与区分效度概念,对 56 个 AI 基准、53 个模型进行系统检验,发现部分基准并未真正度量其宣称测量的能力。由于基准影响 AI 的使用、治理与部署决策,结论对当前评测体系的有效性提出了质疑。

所属事件:COLM 论文检验 56 个 AI 基准,发现多项测不出宣称能力(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →