通用智力指数 GII:用心理测量学从 59 项基准估模型的 g 因子

wyatt400 · reddit · 2026-09-06

作者指出 AI 排行榜用基准平均分合成单一指数存在结构性问题:每项基准对排名的权重相同、高度相关的基准会重复计分同一能力、增删基准就能改变排名。于是构建了 General Intelligence Index(GII),把 IQ 测验估计人类一般智力的心理测量学方法迁移到 AI 评测。

核心思路:不问"模型平均分多少",而问"哪种潜在通用能力最能解释它在所有基准上的表现"。用多维项目反应理论(IRT)从 59 项基准、267 个模型估计潜在 g 因子,并考虑 g 载荷、难度、区分度、信度、测量误差与基准间协方差,对冗余基准降权。

基准自身的 g 载荷差异巨大:ANLI(.986)、ARC-AGI(.958)、HLE(.952)、METR Time Horizons(.935)很高,LAMBADA(.506)、TriviaQA(.290)很低。最终分数标准化为 AIQ 量表(均值 100、标准差 15),当前榜首:Claude Fable 5.1 与 GPT-6 Astra 并列 137 AIQ,Claude Fable 5 / GPT-5.6 Sol 131,Claude Opus 5 130。指数同时给出 90% 置信区间,承认排名精度有限。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →