Spatial-Interactor:让 VLM 像婴儿一样通过交互学会空间推理
arankomatsuzaki · x · 2026-09-27
浙江大学等机构研究者提出 Spatial-Interactor 框架,让视觉语言模型(VLM)通过与物理世界交互来学习空间推理并构建空间记忆,类似婴儿的学习过程。核心思路:现有空间训练多集中在静态属性与关系问答,对状态转移缺乏直接监督;而交互轨迹天然连接了「观察-动作-新观察」,能直接监督局部状态转移,完整轨迹则揭示相邻转移间的依赖。
学习分为三级课程:
- L1 被动观察世界状态变化
- L2 主动操作物体或移动视角,体验自身状态转移
- L3 整合长程交互轨迹,构建空间记忆
团队据此构建了 LSI-108K 数据集(Learning from Spatial Interaction),来自模拟与真实交互轨迹。论文与代码均已公开。
「具身」频道最新
- Claude Opus 5.5 操控机械臂临摹米开朗基罗,自主发现断线并回头修正 — 141_1337 · 2026-09-27
- 蜘蛛形焊接机器人如何对抗电弧电磁干扰 — lukas_m_ziegler · 2026-09-27
- 人形机器人高估了腿?轮式方案在仓储场景更便宜可靠 — VraserX · 2026-09-27
- 1X CEO:目标 2027 年交付 5 万台 NEO 人形机器人 — AIFlow_ML · 2026-09-27
- Optus 量产提速却卡壳:手部 100+ 零件靠手工装配 — AIFlow_ML · 2026-09-27
- $800 捡垃圾机器人 MOSS V0.3 亮相,V0.4 开源版已在打印 — AIFlow_ML · 2026-09-27