用IRT重做AI评测

AI Engineer · youtube · 2026-07-14

这场演讲主张:AI 评测不该继续用“1950 年代式”的简单正确率统计,而应借鉴心理测量学里的 **IRT(Item Response Theory)** 和自适应测验。 ### 核心观点 - 传统评测把每道题当成同等重要,只算对错比例,信息量很低 - IRT 可以把题目放到同一能力尺度上,并给出更真实的误差范围 - 自适应测试能用更少题目测出同样能力,还能做更难被污染的私有/轮换 benchmark - 评测分布还能暴露 **数据泄漏**、题目噪声、模型在哪些能力上“稳”或“靠运气” ### 结论 作者认为,这套方法能让评测更便宜、更难被刷分,也更能告诉我们模型到底学会了什么,而不只是分数有多高。

所属事件:呼吁引入项目反应理论重塑 AI 评测(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →