用IRT重做AI评测
AI Engineer · youtube · 2026-07-14
这场演讲主张:AI 评测不该继续用“1950 年代式”的简单正确率统计,而应借鉴心理测量学里的 IRT(Item Response Theory) 和自适应测验。
核心观点
- 传统评测把每道题当成同等重要,只算对错比例,信息量很低
- IRT 可以把题目放到同一能力尺度上,并给出更真实的误差范围
- 自适应测试能用更少题目测出同样能力,还能做更难被污染的私有/轮换 benchmark
- 评测分布还能暴露 数据泄漏、题目噪声、模型在哪些能力上“稳”或“靠运气”
结论
作者认为,这套方法能让评测更便宜、更难被刷分,也更能告诉我们模型到底学会了什么,而不只是分数有多高。
所属事件:呼吁引入项目反应理论重塑 AI 评测(2 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11