MazeBench 迷宫基准上线:此前 SOTA 智能体仅得 1%

patience_cave · x · 2026-09-04

作者推出 3D 空间推理基准 MazeBench,挑战此前 SOTA 的智能体——它们在迷宫任务上只拿到约 1% 的成绩。作者公开邀请 Astra 与 Fable 等模型来挑战这个「迷宫」,并开放 DM 报名。这被视为检验模型空间导航与长程推理能力的硬核测试。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →