新基准 MazeBench 揭露顶尖 Agent 难以通过基础 3D 关卡
xeophon · x · 2026-08-18
- MazeBench 发布:这是一个 3D 开放世界环境,旨在评估智能体的长期规划与视觉空间推理能力,包含数百个房间和谜题。测试显示,当今最好的 Agent 也无法突破初始关卡,暴露了现有模型在复杂空间规划上的短板。
- 行业批评:另一条转发内容尖锐指出,如果想知道 AI 的前沿能力在何处依然“糟糕透顶”且令人绝望,这段 39 分钟的访谈提供了深入剖析,暗示当前模型在某些核心任务上仍存在根本性缺陷。
「模型」频道最新
- bondingAI 推出企业语言模型 xLLM,主打确定性 — granvilleDSC · 2026-08-18
- Gemini 3.7 Flash 规划提速 2-6 倍,具性价比工作流现身 — rakyll · 2026-08-18
- 回应基准测试:这可能是为了刷榜 — sudoraohacker · 2026-08-18
- 有研究者断言:线性注意力是沉没成本谬误的产物 — jm_alexia · 2026-08-18
- 阿里轻量级 Qwen 评测匹敌 GPT-5.6 Luna — pstAsiatech · 2026-08-18
- 曝 Anthropic 已在部分账号灰度测试 Fable 5 继任模型 — kimmonismus · 2026-08-18