CogGym 基准评测 50 个前沿模型,揭示 AI 与人类认知对齐鸿沟

Lance Ying 等 56 位学者(含 Tenenbaum、Saxe、Fedorenko)发布预印本 CogGym,从 30 多个实验室的 100 篇认知科学论文中收集 258 个实验,构建覆盖心智理论、因果与物理推理、道德判断、语言与语用学的评测集。研究用 R² 与模型-人类分布散度两个指标评测 50 个语言与多模态模型,发现模型与人类的行为对齐程度因认知域而异,其中物理推理分歧最大,显示前沿模型与人类认知间存在明显鸿沟。

2026-10-01 ~ 2026-10-01 · 4 条相关