通用智力指数 GII:用心理测量学从 59 项基准估模型的 g 因子
wyatt400 · reddit · 2026-09-06
作者指出 AI 排行榜用基准平均分合成单一指数存在结构性问题:每项基准对排名的权重相同、高度相关的基准会重复计分同一能力、增删基准就能改变排名。于是构建了 General Intelligence Index(GII),把 IQ 测验估计人类一般智力的心理测量学方法迁移到 AI 评测。
核心思路:不问"模型平均分多少",而问"哪种潜在通用能力最能解释它在所有基准上的表现"。用多维项目反应理论(IRT)从 59 项基准、267 个模型估计潜在 g 因子,并考虑 g 载荷、难度、区分度、信度、测量误差与基准间协方差,对冗余基准降权。
基准自身的 g 载荷差异巨大:ANLI(.986)、ARC-AGI(.958)、HLE(.952)、METR Time Horizons(.935)很高,LAMBADA(.506)、TriviaQA(.290)很低。最终分数标准化为 AIQ 量表(均值 100、标准差 15),当前榜首:Claude Fable 5.1 与 GPT-6 Astra 并列 137 AIQ,Claude Fable 5 / GPT-5.6 Sol 131,Claude Opus 5 130。指数同时给出 90% 置信区间,承认排名精度有限。
「模型」频道最新
- Miles Brundage 质疑:网友口中的 GPT-6 与 Astra 是同一模型? — Miles_Brundage · 2026-09-06
- Astra 生成 Three.js 作品惊艳网友:竟还能精确操作 Blender — victormustar · 2026-09-06
- Astra 实测临床基准仍不敌 Anthropic,智能呈尖峰分布 — danielmckinn0n · 2026-09-06
- Zvi 解读模型安全评测:蜜罐尝试减少 50-75% 内是好信号 — TheZvi · 2026-09-06
- GPT-3到GPT-6:OpenAI API价格五年降了数倍 — BLUECOW009 · 2026-09-06
- Astra被批代码能力严重欠火候,翻车像《不要抬头》 — tokenbender · 2026-09-06