把东京秋叶原 1:1 搬进虚拟世界,最强多模态 agent 也只考了 17 分

360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents

Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa, Kiyoharu Aizawa, Toshihiko Yamasaki

cs.CV, cs.AI, cs.LG

2026-08-10

用 360° 视频重建东京秋叶原做具身导航基准,175 道人工题里最强模型仅 17.1%,人类 77.3%,地图导航全员 0 分。

这篇在解决什么

要让 AI 助手真的融进城市生活(给人指路、帮视障者导航),得先能在真实街景里评测具身 agent。但现有户外评测环境各有短板:3D 模拟器(CARLA、EmbodiedCity)不够逼真、结构也简单;基于谷歌街景的(StreetLearn)画面真实但没动态、全景之间不连续,没法连续走;把真实视频转成模拟环境的(Vid2Sim)又只用短视频片段,撑不起街区尺度的探索。缺一个逼真、有动态(行人车辆)、可连续走、地面第一人称的城区基准。

基准怎么搭

环境底座是作者团队之前做的真实虚拟世界:用 602 段 360° 视频覆盖东京秋叶原 85 条街,视频投到球面、在 Unity 里连成一张可走位姿图,193 个节点、305 条边、平均分支度 3.16,南北约 750 米、东西约 650 米。agent 沿预录轨迹走,不能自由瞬移、也不能物理交互(边界处会有不连续,作者统计这类动作只占 11.3% 且没在失败里过载)。

175 道任务由 8 位亲自去过秋叶原的标注者在 Unity 里手作,耗时约 60 小时,分三大类、七小类(每类 25 题):

每题标易/中/难,难度按路径长、指令歧义、地标可见度而非固定步数。评测用四种协议:精确匹配(定位)、模糊匹配(GPT-5 判,与人类多数票一致率 κ=0.937)、坐标匹配(终点距目标 ε=10 米,地图导航 20 米)、相对准确率 MRA(计数)。

agent 用 ReACT 框架加反思记忆,7 个离散动作(前进、上下左右转头、复位朝向、作答),6 个多模态大模型(GPT-5、Claude Sonnet 4.5、Gemini 2.5 Flash、Qwen2.5-VL-32B、InternVL3.5-8B/38B)。

结果

总分上,最强的 Gemini 2.5 Flash 17.1%,人类 77.3%,差距悬殊。

几个具体发现。地图导航所有模型全是 0%(人类 92%),是最难的,给张俯视图也走不到。给图片找地标比给名字容易:GPT-5 图片版 48 分、文字版 16 分,因为图片带外观、纹理、周边场景这些文字描述给不出的线索(InternVL 是例外,没从图片版受益)。难度上升性能稳定下降。给了当前位置地图信息并不稳定帮忙,有时反而拖后腿(关系推理从 48% 掉到 32%),说明 agent 把地图位置和第一人称视觉对齐这件事本身就难。

失败模式因模型而异:GPT-5 基本不犯低级动作错误,但卡在探索策略差(占 55%);Gemini 和 InternVL 主要栽在低层动作控制(约 40%);空间推理任务里感知失败在所有模型里飙升(Gemini 达 38%),漏看细小视觉细节是致命的。

为什么重要

它把具身 agent 在真实城区里到底行不行这个问题,从模糊的观感变成了可复现、可拆解的量化考核。光有照片级真实感还不够,还得有动态(行人车辆)、连续可走、第一人称,这套环境四样都占了。对做多模态大模型和具身智能的人,它的诊断价值在于能告诉你某个模型是输在感知、定位、探索还是规划,不是笼统一句不行。地图与视觉对齐这个被低估的短板,值得单独拎出来做。

局限与存疑

作者自陈:目前只有一个城区(秋叶原),跨区域泛化的结论下不了;agent 只能沿预录轨迹走,不能自由漫游,边界处可能有不连续,也不支持物理交互(虽然数据显示边界动作没在失败里过载)。

一点存疑:人类基线是去过秋叶原的本地专家,不是普通人,等于给人类开了领域知识外挂,所以 77.3% 是个偏高的上界,模型和普通人的真实差距可能没纸面那么大,但这不影响模型还很差这个主结论。另外 175 道题、每小类 25 道,样本量不大,单项分数(尤其那些个位数)的置信区间不会窄,排序比绝对分数更可信。

术语

原文与代码

社区讨论

相关论文

全部论文解读