MazeBench 被传统求解器攻破,作者承认难度在感知不在搜索
patience_cave · x · 2026-09-03
MazeBench 作者与独立开发者 FakePsyho 展开讨论。FakePsyho 在拿到源代码后写了一个离线求解器:分开的房间求解器(优化版 BFS)加简单胶水逻辑组成世界求解器,仅花几小时优化代码就拿到不错成绩,并发现现有关卡中没有任何对求解器「对抗性」设计的谜题。
作者据此承认 MazeBench 目前的难度是感知层面的而非求解层面的,后半部分关卡将更新,并计划在 astra 深入之前加强关卡设计。他还提到有用户设计的关卡让 sol xhigh + codex 花了几小时才解出,另有一个必须盲解的迷宫隧道关卡;人类排行榜上 gem 数封顶在 80 左右,因为最后一批关卡仍在制作和质检中。
所属事件:MazeBench 被传统 BFS 求解器攻破,难点在感知(3 条相关)→
「研究」频道最新
- PufferLib 5.0 自博弈演示:$700 电脑 5 分钟训练双 agent 帆船对战 — yacineMTB · 2026-09-03
- Until Labs 用 AI 筛选超 25 万分子,破解玻璃化冷冻保护剂难题 — lukaszkaiser · 2026-09-03
- 斯坦福学者提出「What-If 机器」:用 AI 行为模拟预演商业决策 — msbernst · 2026-09-03
- 字节跳动研究:循环 Transformer 计算效率反超,加深模型或非最优解 — georgejrjrjr · 2026-09-03
- Schmidhuber 谈循环深度:2015 年论文已提出抽象空间内思考 — SchmidhuberAI · 2026-09-03
- 开源检索研究者 Matthew Yang 入读 MIT 读博 — lateinteraction · 2026-09-03