COLM 论文检验 56 个 AI 基准,发现多项测不出宣称能力
被 COLM 接收为口头报告的论文《What AI Benchmarks Actually Measure》借鉴社会科学中的聚敛效度与区分效度概念,对 56 个 AI 基准、53 个模型进行大规模系统检验,发现部分基准并未真正度量其宣称测量的能力,结果出人意料。鉴于基准直接影响 AI 的使用与治理,这一发现对基准可信度和模型评估实践具有重要意义。
2026-09-29 ~ 2026-09-29 · 2 条相关
- COLM 口头报告论文:用效度检验审问 56 个 AI 基准,结果出人意料 — ang3linawang · 2026-09-29
- 研究:56 个 AI 基准×53 个模型,多项基准测不出宣称的能力 — sanmikoyejo · 2026-09-29