MazeBench 迷宫基准上线:此前 SOTA 智能体仅得 1%
patience_cave · x · 2026-09-04
作者推出 3D 空间推理基准 MazeBench,挑战此前 SOTA 的智能体——它们在迷宫任务上只拿到约 1% 的成绩。作者公开邀请 Astra 与 Fable 等模型来挑战这个「迷宫」,并开放 DM 报名。这被视为检验模型空间导航与长程推理能力的硬核测试。
「研究」频道最新
- AI 首次完整绘制雄性果蝇全脑与中枢神经,标记超 16.6 万神经元 — Polymarket · 2026-09-04
- 用 1/100 数据超越 pi0.5,符号世界模型在物理 AI 复活 — furongh · 2026-09-04
- Sparse Readout Prism:用稀疏特征解释 Logit Lens 分数 — Matteo He · 2026-09-04
- ARC-AGI 主办方:给模型套超强提示词,测的是人不是模型 — GregKamradt · 2026-09-04
- 哈佛 RCT:AI 导师学习效率超过课堂主动学习 — ___Patrice___ · 2026-09-04
- 加纳实验:WhatsApp AI 数学家辅使成绩提升,效应量达 0.37 — ___Patrice___ · 2026-09-04