UrbanGround基准:让模型在3D香港「走路」,长路线10模型全趴
jiqizhixin · x · 2026-09-15
上海交通大学、新加坡国立大学、美团、香港中文大学、上海大学与牛津大学联合发布 UrbanGround 基准,揭示城市空间智能的真实短板。
现状反差:看街景图识别地标,最强模型准确率可达 75–93.8%;但让模型真正「走进」城市,短程导航最好模型完成 75% 任务,路线一拉长,全部 10 个模型跌至 0–3.8%——「走两步就迷路」。
与既有基准的区别:过去的城市空间智能基准停留在单张街景或航拍图的问答,导航基准也只沿预设节点切换视角;UrbanGround 用真实地理数据构建 3D 香港沙盒,模型以第一人称在其中导航:查地图、过天桥、撞墙、遇到封路与移动行人。答对问题只是起点,连续穿行才是真正的考验。
「研究」频道最新
- Voodoo 动态量化方法开源 MIT:用梯度下降为每个张量选量化级别 — 1ncehost · 2026-09-15
- 研究者提出心盲症与抽象符号能力或塑造人类语言演化 — abenitezburraco · 2026-09-15
- LLM 合成概率程序:MIT 系论文提出混合架构逼近人类开放世界推理 — xuanalogue · 2026-09-15
- 概率编程派辩护:学习仍可保留,只是学到符号化程序库 — xuanalogue · 2026-09-15
- 牛津团队发「Theory Is All You Need」,论证 LLM 无法产生真新知 — Maleficent-Foot4913 · 2026-09-15
- DuckDB 扩展 FlockMTL:在 SQL 里直接调用 LLM 与 RAG 做分析 — _reachsumit · 2026-09-15