研究引入心理测量效度方法系统评估 AI 基准

研究团队提出将心理测量学中的聚敛效度与区分效度移植到 AI 基准评估:声称测量相似概念的基准之间应当相关,声称测量不同概念的基准则不应相关。团队还结合项目反应理论(IRT)模型在题目层面提出同样问题,实现更细粒度的效度检验。该方法既可帮助基准开发者评估单个基准的有效性,也适用于更广泛的基准审查场景。

2026-09-29 ~ 2026-09-29 · 2 条相关