Scale AI 新基准:最强模型直觉视觉推理仅 53.6%,人类 93.1%
geoffwolfe · x · 2026-10-10
Scale AI 与 Elorian 联合发布开源基准 Humanity's Sixth Sense (HSS),测「看懂场景含义」的直觉视觉推理:522 个人工编写任务,覆盖时间、空间、社会与抽象结构 4 大域 11 个子域,配基于 rubric 的判分,每任务 pass@1 取三次平均。
关键结论:
- 最强模型 GPT-6-astra(最高推理档)仅 53.6%,人类标注员 93.1%;多数模型低于 40%,中位数 30.9%。
- 25 个模型平均每任务生成约 4000 推理 token,常「过度思考仍答错」。
- 23/25 模型在视频任务上比静态图平均低 7.3 个百分点。
- 社会理解是最弱领域:21/25 模型的最低分项,平均仅 24.4%,其余三域均值 34.1%。
数据集与评测代码均开源在 Hugging Face。
所属事件:Scale AI 发布 HSS 基准:人类直觉视觉推理 93.1%,最强模型仅 53.6%(8 条相关)→
「多模态」频道最新
- 像素模型 Iris 2 接入 ComfyUI:自定义 loader 证明 VAE 非必需 — Incognit0ErgoSum · 2026-10-10
- 千款视频模型怎么选:先过滤再打分,别让 agent 自由发挥 — Vaciuum1 · 2026-10-10
- 阿里 TaoLive 推出 TaoMate-H3,三步去噪实现分钟级流式视频生成 — jiqizhixin · 2026-10-10
- SGLang-Diffusion 扩散模型推理框架将亮相 PyTorch 大会 — PyTorch · 2026-10-10
- 开源项目 image-blaster:一张照片五分钟生成完整可探索 3D 世界 — anthara_ai · 2026-10-10
- Holly Herndon 与 Mat Dryhurst 获 MoMA 首个双场馆委约作品 — matdryhurst · 2026-10-10