HSS 新基准:顶级模型过司考却算不准苹果能否装进饭盒

dustinvtran · x · 2026-10-08

Elorian 与 Scale AI 联合发布新基准 Humanity's Sixth Sense (HSS),共 522 道题,专测人类轻松掌握的直觉性视觉推理(空间可用性、回溯推断、机械因果、社会角色规范等)。

评测结果显示 GPT 6 Astra、Gemini 3.8 Flash、Claude Opus 5.5 在多道示例题上全部答错且三次尝试均失败:

结论:前沿模型能通过律师资格考试,却在人类直觉物理与常识推理上系统性失败,暴露出视觉理解的「第六感」缺口。

所属事件:Scale AI 发布 HSS 基准:顶级 AI 直觉视觉推理远逊人类(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →