迷宫 benchmark 用 45 度转向测试模型的空间记忆与工具调用

TheRealMasonMac · reddit · 2026-07-25

作者做了一个迷宫 benchmark,用来测试模型的空间感知、记忆能力和工具调用能力。任务很简单:先找到钥匙,再开门,最后逃出去;每次动作后都会返回可观察到的环境信息。

为了让任务可做,系统提供了前进/后退、以 45° 为步进转向、开门、捡取物品等工具。作者还在模型总是迷路后,额外标注了哪些格子可以通行。初步测试里,GPT-5.4 mini 和 GLM-5.2 都在绕圈,而 K2.6 表现更好;GLM-5.2 累计用了约 6200 万 tokens,K2.6 约 900 万,但作者也说明两者设置并不完全可比。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →