迷宫 benchmark 用 45 度转向测试模型的空间记忆与工具调用
TheRealMasonMac · reddit · 2026-07-25
作者做了一个迷宫 benchmark,用来测试模型的空间感知、记忆能力和工具调用能力。任务很简单:先找到钥匙,再开门,最后逃出去;每次动作后都会返回可观察到的环境信息。
为了让任务可做,系统提供了前进/后退、以 45° 为步进转向、开门、捡取物品等工具。作者还在模型总是迷路后,额外标注了哪些格子可以通行。初步测试里,GPT-5.4 mini 和 GLM-5.2 都在绕圈,而 K2.6 表现更好;GLM-5.2 累计用了约 6200 万 tokens,K2.6 约 900 万,但作者也说明两者设置并不完全可比。
「编程与Agent」频道最新
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一个 VS Code 扩展给 Alchemy 模板加上 Markdown 高亮 — samgoodwin89 · 2026-07-27
- Claude 的 Stripe MCP 连接器被吐槽频繁断连几乎不可用 — evielync · 2026-07-27
- Reddit 用户称 Vecel Eve 像给 agents 用的 Next.js — richie9830 · 2026-07-27
- 卡兹克开源 Leader.skill:把模糊需求变成 Agent 目标书 — 数字生命卡兹克 · 2026-07-27
- MiniBot 2.40 新增 xAI、HF Studio 和 vLLM 支持 — Creative-Type9411 · 2026-07-27