研究汇总 30+ 实验室 258 个实验,构建大模型认知评测基准

xuanalogue · x · 2026-10-01

论文线程介绍:研究团队从 30+ 个研究实验室、100 篇论文中收集了 258 个实验,构建覆盖心智理论、因果与物理推理、道德判断、语言与语用学等主题的评测集,用于衡量大模型与人类的认知对齐程度。结合同线程另一条,他们随后用 R² 与分布散度两个指标评测了 50 个语言与多模态模型,发现前沿模型与人类之间仍存在认知对齐差距。

所属事件:CogGym 基准评测 50 个前沿模型,揭示 AI 与人类认知对齐鸿沟(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →