用IRT重做AI评测
AI Engineer · youtube · 2026-07-12
这场演讲主张:AI 评测不该再沿用“答对多少题”的老式做法,而应借鉴心理测量学中的项目反应理论(IRT)。
核心观点包括:
- IRT 能把每道题放到统一尺度上,并给出误差范围,判断哪些题有效、哪些只是噪声。
- 适应性测试可以用更少题目测同样能力,从而构建更难被污染、可轮换的私有基准。
- 题目拟合统计特性还能暴露数据泄漏/答案泄露,比单一分数更能看出模型真正学到了什么。
演讲者 Alejandro Vidal 认为,这类方法能让 eval 更便宜、更难刷分,也更能揭示模型能力边界与知识缺口。
所属事件:呼吁引入项目反应理论重塑 AI 评测(2 条相关)→
「研究」频道最新
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11