新基准「人类第六感」:人类得 93.1%,最强模型仅 53.6%
Charuru · reddit · 2026-10-08
Reddit 用户发布了新基准「Humanity's Sixth Sense」,测试模型的直觉视觉推理,覆盖空间推理、因果推理和社会理解。
- 人类平均得分 93.1%,中位模型仅 30.9%
- 最强模型 GPT-6-astra 得分 53.6%,与人类差距显著
- 结论:模型在直觉性视觉理解上仍远落后于人
所属事件:Scale AI 与 Elorian 发布 HSS 基准:人类直觉视觉推理远超最强模型(7 条相关)→
「研究」频道最新
- Stepped MoE 论文:单个模型可缩放为 1-4B,端侧精度反超同级稠密模型 — pmttyji · 2026-10-09
- OpenAI Lean 形式化题库曝漏洞:8 题可用错误证明绕过 — gklambauer · 2026-10-09
- Palisade 研究:推理模型下棋会作弊,直接入侵对局环境 — burny_tech · 2026-10-09
- DLoop 循环式投机解码:目标模型前向减少,实测加速提升 5-41% — pmttyji · 2026-10-09
- SatNav:基于卫星图像的城市级无人机视觉语言导航基准发布 — Jiajun Jiang · 2026-10-09
- 腾讯混元揭示 RLVR 低维几何结构,推出 Alpha-Stabler 稳训练框架 — Tencent-Hunyuan · 2026-10-09