香港1:1沙盒里MLLM短距能到,跨街区导航成功率掉近零

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu, Pengzhou Cheng, Haodong Zhao, Zongru Wu, Xinbei Ma, Doris Zhang, Kunling Li, Mong-Li Lee, Wynne Hsu, Hao Fei, Qi Gu, Gongshen Liu, Zhuosheng Zhang

cs.CV

2026-08-28

UrbanGround把香港全境三维地理数据做成可闭环的第一人称城市,测十个MLLM:短距导航有的能到75%,长程几乎全失败,封路后安全进度最高46.7%。

这篇在解决什么

多模态大模型已经能看懂一张街景:认出药店、读路牌、回答附近有什么。城市里的行动力取决于下一步。拐过弯,刚才那块路牌从视野里消失,位姿估计还得接着用。游戏沙盒尺度不够、规则不像真实城市;街景跳点没有连续碰撞;室内导航又太小。缺的是一座按真实地理建起来、动作会改下一帧证据的城市。

方法

UrbanGround 用香港地政总署的三维可视化地图和三维行人网络,把全境倾斜摄影网格和行人连通图送进 Unity。代理是第一人称角色,运动连续、跟建筑和地形碰撞,轨迹记在同一套地理坐标里。行人网络用来对照,不把代理锁在边上。环境可调昼夜、雨雾,人行道上有 Rocketbox 行人。

观察是当前第一人称 RGB,可选有限帧缓存。全局任务另给可平移缩放的地图,标出当前位置,不给最短路或高亮路线。动作每次选一个:move/sprint/look/jump,或地图的选择、平移、缩放、环视,或结束。单局最多 100 步,每步移动最长 2 秒。

任务做成五级梯子,共 810 条人工核过的实例。Level 1 本地问答(视觉识别、朝向、主动探索);Level 2–4 从明示短导航拉到隐含目的地和多站规划;Level 5 中途封路和行人穿行。到达判定是终点 15 米内。指标含答题准确率、导航成功率、行人网络附着率(PNA),封路另报安全进度 SPR,行人另报碰撞率 PCR。评了 GPT、Claude、Gemini、豆包、GLM、Kimi 十个模型,提示词按任务类型固定。

结果

本地认物已经可用,朝向和长程控制不是同一档能力。

模型视觉识别 Acc朝向 Acc短导航长导航导航总体
Claude-Opus-591.358.348.82.517.9
Gemini-3.6-Flash93.856.723.80.08.1
GPT-5.582.540.075.00.020.8
Kimi-K392.555.067.53.822.5
Claude-Opus-4.685.046.775.01.322.9

朝向题上,Gemini-3.1-Pro 只有 23.3,接近四选一乱猜。主动探索答题还能到 46–83,但代理常抄近路离开行人网络。短导航 GPT-5.5 和 Claude-Opus-4.6 到 75%;同一套点到点拉长到几个街区,成功率掉到接近零。指令导航、约束路径、多站规划同样差。长导航里仍有 50% 以上回合终点比起点更近,多站平均只碰到 10%–20% 的必经点:方向感还在,全局路线状态保不住。

天气和昼夜主要伤本地问答,短导航受影响更不齐。封路任务成功率基本是 0,PNA 仍在 93% 以上,Claude-Opus-5 的安全进度最高也只有 46.7%。行人场景碰撞率 76%–90%,走在网上不等于会让人。

为什么重要

「能看懂街景」推不出「能在一座真城里走完」。UrbanGround 把这条断裂画在同一座地理框架里:原子感知过关,组合进持续目标行为时错误会累积且不会自我纠正。做城市 agent、具身导航或地图工具的人,不该再用短距问答代理长程闭环。沙盒开源,后续可以在同一座城里测记忆、重规划和行人礼让。

局限与存疑

正文没有独立 Limitations。网格来自倾斜航空摄影,近地细节和室内不可用。行人网络不约束运动,PNA 是事后对照。到达半径 15 米对城市步行偏松,可能抬高短导航。100 步上限对长程苛刻,但人类测试者在同一上限内做完了全部实例。封路靠一次系统通知加地图标记,不是代理自己发现施工。评的是带交互历史的 MLLM agent,不是专用导航策略,也没有把地图 API 最短路当对照。香港地形和立体行人通道很特殊,换一座更平的城,数字可能没这么难看。

术语

原文与代码

社区讨论

相关论文

全部论文解读