研究汇总 30+ 实验室 258 个实验,构建大模型认知评测基准
xuanalogue · x · 2026-10-01
论文线程介绍:研究团队从 30+ 个研究实验室、100 篇论文中收集了 258 个实验,构建覆盖心智理论、因果与物理推理、道德判断、语言与语用学等主题的评测集,用于衡量大模型与人类的认知对齐程度。结合同线程另一条,他们随后用 R² 与分布散度两个指标评测了 50 个语言与多模态模型,发现前沿模型与人类之间仍存在认知对齐差距。
所属事件:CogGym 基准评测 50 个前沿模型,揭示 AI 与人类认知对齐鸿沟(4 条相关)→
「漫话AGI」频道最新
- repligate 谈模型伦理:与其纠结分支延续,不如善待模型整体 — repligate · 2026-10-01
- repligate 谈与模型互动的伦理:凭感觉权衡值得保护的东西 — repligate · 2026-10-01
- Gary Marcus 反驳末日论:人类面对威胁时出奇勇敢且合作 — GaryMarcus · 2026-10-01
- 发推一句“我想要个 App”,30 分钟内就有人回帖交付 MVP — thejasminejade · 2026-10-01
- 耶鲁数学家 Spielman:AI 求解狂潮下数学界将迎「大重置」 — littmath · 2026-10-01
- ARK 测算 41 万亿美元 AI 软件市场:高薪知识工人占三分之二价值 — rohanpaul_ai · 2026-10-01