将心理测量效度检验移植到 AI 基准与 IRT 逐题分析
sanmikoyejo · x · 2026-09-29
为把聚敛与区分效度适配到基准评估,团队检验了声称测相似概念的基准是否相关、声称测不同概念的基准是否不相关,并用 IRT(项目反应理论)模型在题目层面提出同样的问题,实现更细粒度的效度检验。
所属事件:研究引入心理测量效度方法系统评估 AI 基准(2 条相关)→
「研究」频道最新
- EAPO:熵引导 credit assignment,让 LLM 推理强化学习更会探索 — coallaoh · 2026-09-29
- 让扩散模型故意塌缩:从预训练权重中提取人群图谱 — kwangmoo_yi · 2026-09-29
- Duplex-MPE 基准测 AI 何时该开口:MiniCPM-o 4.5 三项领先 — PKU · 2026-09-29
- PReCache:免训练 KV 缓存共享,Multi-LoRA 智能体 TTFT 提速 3.1 倍 — SNU-VLSI · 2026-09-29
- REALM 生成反应式听者面部动作,已部署到 Ameca 人形机器人 — MacquarieUni · 2026-09-29
- KAIST FlyBy 框架教小模型识别知识瓶颈,4B 以更低成本超 Qwen3-14B — kaist-ai · 2026-09-29