Scale AI 新基准:人类得 93.1 分,最强模型 GPT-6-astra 仅 53.6

dustinvtran · x · 2026-10-08

Scale AI 与 ElorianAI 合作推出「Humanity's Sixth Sense」基准,测试人类日常依赖的直觉视觉推理,涵盖 522 个开放式图文与视频任务,覆盖空间与因果推理、社交理解等维度。结果差距显著:人类平均 93.1%,最强模型 GPT-6-astra 仅 53.6%,模型中位数只有 30.9%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →