用IRT重做AI评测
AI Engineer · youtube · 2026-07-14
这场演讲主张:AI 评测不该继续用“1950 年代式”的简单正确率统计,而应借鉴心理测量学里的 **IRT(Item Response Theory)** 和自适应测验。 ### 核心观点 - 传统评测把每道题当成同等重要,只算对错比例,信息量很低 - IRT 可以把题目放到同一能力尺度上,并给出更真实的误差范围 - 自适应测试能用更少题目测出同样能力,还能做更难被污染的私有/轮换 benchmark - 评测分布还能暴露 **数据泄漏**、题目噪声、模型在哪些能力上“稳”或“靠运气” ### 结论 作者认为,这套方法能让评测更便宜、更难被刷分,也更能告诉我们模型到底学会了什么,而不只是分数有多高。
所属事件:呼吁引入项目反应理论重塑 AI 评测(2 条相关)→
「研究」频道最新
- Apple 提出无需真实环境的 API 智能体合成数据方法 — _akhaliq · 2026-07-21
- MIT 博士生称递归语言模型或重塑编码智能体设计 — ctjlewis · 2026-07-21
- Robin Hanson:美国发明近两世纪来越来越不相似 — sebkrier · 2026-07-21
- Tri-Net v2 开源猴痘检测框架,配套 Scientific Reports 论文 — Rich-Fruit-326 · 2026-07-21
- 论文称只训练一层 Transformer 也能匹配全参数 RL — RisingSayak · 2026-07-21
- 把数据集打包成顺序 blob,训练吞吐提升 30% — irinarish · 2026-07-21