SpatialCLI:教视觉语言模型用空间工具推理并逐步内化
Yang Zhou · hf · 2026-07-31
通用视觉语言模型(VLM)能推理整体任务,但常丢失决定成败的视觉细节;而专家视觉模型能捕捉细节却无法转化为任务级决策。为此,本文提出 SpatialCLI 框架。
该框架教导VLM使用空间工具,并逐步将这些专家感知能力内化,分为三个阶段:
- Call:将专家视觉模型作为空间工具暴露给VLM。
- Learn:使用冷启动SFT和智能体RL改进工具使用。
- Internalize:将成功的工具使用轨迹转化为语言,内化专家感知能力。
实验显示,在MindCube上,SpatialCLI将Qwen3-VL-8B的准确率从29.3%提升至84.6%(带工具),超越了带工具的GPT-5.6 Sol(72.1%),且在内化后无工具状态下仍保持73.8%的准确率。
「研究」频道最新
- Meta 提出 OneShot 检索框架,已部署于 Instagram — _reachsumit · 2026-07-31
- Google 提出 HA-MoE 架构,提升多内容流推荐公平性 — _reachsumit · 2026-07-31
- 研究:利用大模型自然语言标签增强生成式推荐 — _reachsumit · 2026-07-31
- Meta 提出 ROCS 推荐推理范式,检索 QPS 最高提升 3 倍 — _reachsumit · 2026-07-31
- 强制审稿制度下,AI 学术会议的低质量评审不应再被容忍 — Kwangryeol · 2026-07-31
- HiLaR 框架:用分层强化学习优化 LLM 推荐推理 — _reachsumit · 2026-07-31