几小时写出 BFS 求解器攻穿 MazeBench,还发现计分口径疑问
FakePsyho · x · 2026-09-02
独立开发者 FakePsyho 分享了他对 MazeBench 的攻法:拿到源码后为降低「摩擦」直接写离线求解器——房间求解器基本是优化版 BFS,没有大技巧,加上把房间求解器串成世界求解器的简单胶水层,使其始终专注于谜题前沿而不重复探索已解房间。几小时(主要是代码优化)就完成求解器并拿到 31 颗 gem 的成绩。
他惊讶地发现现有关卡没有从状态搜索角度「对抗」求解器的设计——这本可以用来让带 harness 的 AI 更难破解。他还指出计分口径疑问:人类排行榜目前最高 233 房间 / 80 gem,而官方分数却按总 gem 为 100 计算,询问原因。
所属事件:独立开发者用 BFS 求解器攻穿 MazeBench 基准(3 条相关)→
「研究」频道最新
- 俄罗斯团队创 Mostik:让模型用权重「心电感应」,混合模型登顶 ARC-AGI 3 — nordicinst · 2026-09-03
- 字节开源 LoopLM:循环潜空间推理让 1.4B 模型比肩 12B 竞品,Bengio 参与 — peterjliu · 2026-09-03
- 传 OpenAI 新技术削弱 CoT 可监控性,Bengio 等联署论文作者回应 — GaryMarcus · 2026-09-03
- PufferLib 作者称调优后端到端提速约 3 倍 — yacineMTB · 2026-09-03
- 哈佛提出 agentic data cracking,非结构化数据问答成本降 53% — Harvard · 2026-09-03
- 学生 5 英镑/月跑起可解释的 X 光骨病变筛查模型 — xrY- · 2026-09-03