研究:56 个 AI 基准×53 个模型,多项基准测不出宣称的能力
sanmikoyejo · x · 2026-09-29
一项大规模研究借鉴社会科学中的聚合效度与区分效度概念,对 56 个 AI 基准、53 个模型进行系统检验,发现部分基准并未真正度量其宣称测量的能力。由于基准影响 AI 的使用、治理与部署决策,结论对当前评测体系的有效性提出了质疑。
所属事件:COLM 论文检验 56 个 AI 基准,发现多项测不出宣称能力(2 条相关)→
「研究」频道最新
- 470万条解释实验:只审计5%的token位置即可发现prompt注入威胁 — aisilab · 2026-09-30
- 南洋理工 PerF:像素空间扩散DiT按特征分层精炼,FID低至1.63 — NanyangTechnologicalUniversity · 2026-09-30
- IBM提出Q&D训练法:智能体主动追问所需信息,胜过15倍大模型 — ibm · 2026-09-30
- 研究者预测:AI 将速通数学猜想,转向材料与药物发现 — tak3sh8 · 2026-09-30
- Stephen Wright 等三套机器学习优化公开课视频上线,覆盖大步长与隐式偏差 — caglar_ee · 2026-09-30
- 开源框架 Arbor 让 AI agent 自主长期科研,无需人类逐步监督 — burkov · 2026-09-30