SpatialCLI:教视觉语言模型用空间工具推理并逐步内化

Yang Zhou · hf · 2026-07-31

通用视觉语言模型(VLM)能推理整体任务,但常丢失决定成败的视觉细节;而专家视觉模型能捕捉细节却无法转化为任务级决策。为此,本文提出 SpatialCLI 框架。

该框架教导VLM使用空间工具,并逐步将这些专家感知能力内化,分为三个阶段:

实验显示,在MindCube上,SpatialCLI将Qwen3-VL-8B的准确率从29.3%提升至84.6%(带工具),超越了带工具的GPT-5.6 Sol(72.1%),且在内化后无工具状态下仍保持73.8%的准确率。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →