新研究:评测 50 个前沿模型,发现其认知与人类存在对齐鸿沟
xuanalogue · x · 2026-10-01
转发的论文线程介绍了一项认知对齐研究:研究团队用 R² 与模型-人类分布散度两个互补指标,评测了 50 个语言与多模态模型,发现当前前沿模型与人类在认知层面存在明显差距(gap in cognitive alignment)。结合同线程另一条,该研究的数据来自 100 篇论文、30+ 研究实验室的 258 个实验,覆盖心智理论、因果与物理推理、道德判断、语言与语用学等主题。
所属事件:CogGym 基准评测 50 个前沿模型,揭示 AI 与人类认知对齐鸿沟(4 条相关)→
「模型」频道最新
- Gemini 4 Argon 在 AA Coding Agent Index 编码测试表现亮眼 — prateeky2806 · 2026-10-01
- Anthropic 评估:GLM-5.3 可自主构建 Chrome 漏洞利用,防护近乎为零 — matthew_d_green · 2026-10-01
- Artificial Analysis 公布 Solar Mini 4 完整智能指数测试结果 — ArtificialAnlys · 2026-10-01
- Upstage 发布 Solar Mini 4:3B 激活参数拿下 Intelligence Index 24 分 — ArtificialAnlys · 2026-10-01
- 红队测试 GLM 5.3 发现诡异输出,怀疑 OpenRouter 路由到 1bit 量化版 — voooooogel · 2026-10-01
- 谷歌员工自曝 Gemini 4 擅长长上下文:摄取与长序列生成都强 — RubenEVillegas · 2026-10-01