Scale AI 新基准:人类得 93.1 分,最强模型 GPT-6-astra 仅 53.6
dustinvtran · x · 2026-10-08
Scale AI 与 ElorianAI 合作推出「Humanity's Sixth Sense」基准,测试人类日常依赖的直觉视觉推理,涵盖 522 个开放式图文与视频任务,覆盖空间与因果推理、社交理解等维度。结果差距显著:人类平均 93.1%,最强模型 GPT-6-astra 仅 53.6%,模型中位数只有 30.9%。
「研究」频道最新
- LEDGER 发布:看一眼即记住,自我中心视频构建持久 3D 物体记忆 — mangahomanga · 2026-10-08
- LEDGER:从第一视角视频构建持久 3D 物体记忆,不看回放答题 — mangahomanga · 2026-10-08
- Applied Compute 发布 On-Policy 自蒸馏,逼近持续学习 — ypatil125 · 2026-10-08
- NavSafe-∞ 基准:280 个闭环场景测出 20 个端到端驾驶策略的安全缺口 — zhoubolei · 2026-10-08
- 实测:pplx-decider 可开箱即用地替代 Fineweb-edu 分类器筛数据 — bo_wangbo · 2026-10-08
- 1824 节点超算下棋惨败 Pentium:MIT 借机催生 work stealing — lauriewired · 2026-10-08