Spatial-Interactor:让 VLM 像婴儿一样通过交互学会空间推理

arankomatsuzaki · x · 2026-09-27

浙江大学等机构研究者提出 Spatial-Interactor 框架,让视觉语言模型(VLM)通过与物理世界交互来学习空间推理并构建空间记忆,类似婴儿的学习过程。核心思路:现有空间训练多集中在静态属性与关系问答,对状态转移缺乏直接监督;而交互轨迹天然连接了「观察-动作-新观察」,能直接监督局部状态转移,完整轨迹则揭示相邻转移间的依赖。

学习分为三级课程:

团队据此构建了 LSI-108K 数据集(Learning from Spatial Interaction),来自模拟与真实交互轨迹。论文与代码均已公开。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →