将心理测量效度检验移植到 AI 基准与 IRT 逐题分析

sanmikoyejo · x · 2026-09-29

为把聚敛与区分效度适配到基准评估,团队检验了声称测相似概念的基准是否相关、声称测不同概念的基准是否不相关,并用 IRT(项目反应理论)模型在题目层面提出同样的问题,实现更细粒度的效度检验。

所属事件:研究引入心理测量效度方法系统评估 AI 基准(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →