HSS 新基准:顶级模型过司考却算不准苹果能否装进饭盒
dustinvtran · x · 2026-10-08
Elorian 与 Scale AI 联合发布新基准 Humanity's Sixth Sense (HSS),共 522 道题,专测人类轻松掌握的直觉性视觉推理(空间可用性、回溯推断、机械因果、社会角色规范等)。
评测结果显示 GPT 6 Astra、Gemini 3.8 Flash、Claude Opus 5.5 在多道示例题上全部答错且三次尝试均失败:
- 判断书架空隙能否再放两本书——模型都说放不下
- 从画面回溯旅行者进入方向——模型判断错误
- 判断链条是否承受犁的拖拽重量——模型称链条松弛
- 区分飞机旁人员是访客还是检修机组——模型误判
- 判断发动机轴旋转时外罩是否跟着转——模型答错
结论:前沿模型能通过律师资格考试,却在人类直觉物理与常识推理上系统性失败,暴露出视觉理解的「第六感」缺口。
所属事件:Scale AI 发布 HSS 基准:顶级 AI 直觉视觉推理远逊人类(2 条相关)→
「模型」频道最新
- Bengio 撰文驳「AI agent 入侵只是沙箱问题」,安全责任之争激化 — AlexTensor · 2026-10-08
- OpenAI 模型证明 Q 上希尔伯特第十问题不可判定,绕开 80 年老路 — aran_nayebi · 2026-10-08
- Anthropic 调整 $200 档后,该选 Opus 还是 Sonnet?播客拆解选型逻辑 — thursdai_pod · 2026-10-08
- AI 能证黎曼猜想却排不好周末行程?作者自嘲观点反转 — jxmnop · 2026-10-08
- OpenRouter 数据:用得最多的模型和被付费最多的模型正在分家 — Spiritual_Skirt_9312 · 2026-10-08
- 一句话方法论:把模型轻轻推出分布之外才有好答案 — _Stocko_ · 2026-10-08