COLM 口头报告论文:用效度检验审问 56 个 AI 基准,结果出人意料
ang3linawang · x · 2026-09-29
一篇被 COLM 接收为口头报告的论文《What AI Benchmarks Actually Measure》将心理测量学中的聚合效度与区分效度方法引入 AI 基准评估,系统检验了 56 个 AI 基准:本应测量相似概念的基准之间相关性出人意料,声称测量不同概念的基准却意外高度相关,说明许多基准测的可能并非其声称的能力。
「研究」频道最新
- 30 多实验室复现失败:Marcus 1999 年 16 名婴儿的经典研究遭挑战 — tallinzen · 2026-09-29
- NLP 传奇 Chris Manning 播客:语言模型先学动词类别再学单个动词 — ziv_ravid · 2026-09-29
- 统计学者互怼:什么样的贝叶斯更新规则才算合格 — RexDouglass · 2026-09-29
- Google 发布多智能体 AI 视频联合导演框架,解决长视频一致性难题 — rseroter · 2026-09-29
- Google 实习成果 BLUE 入选 NeurIPS,用 LLM 画像提升推荐效果 — shangbinfeng · 2026-09-29
- 数学家 Kontorovich 剖析 Collatz 论证盲区:同样适用于 3x-1,难以区分轨道根 — AlexKontorovich · 2026-09-29