浙大 OmniAI 发布 Spatial-Interactor:交互式训练 VLM 空间推理
OmniAI-ZJU · hf · 2026-09-24
- 针对 VLM 空间推理短板:感知物体运动与视角变化引发的局部状态转移,并在长轨迹上整合这些转移,现有模型与静态问答式训练都受限。
- 提出 Spatial-Interactor 框架,通过与可观测物理世界交互来学习状态转移,分三级课程:L1 被动世界状态转移、L2 主动自身状态转移、L3 长程交互轨迹。
- 构建 LSI-108K 数据集(仿真+真实交互轨迹),任务与各级课程对齐。
- 两阶段训练:SFT 训练 L1/L2 局部转移建模;On-Policy Distillation 用带特权信息的教师分支(给分段转移描述)监督学生 on-policy CoT,学会整合长程轨迹。
- 在多个 VLM 与空间 benchmark 上取得一致提升。
「研究」频道最新
- 同一提示词 GPT-3.5 全说漏,GPT-4 却 30/30 返回空响应 — rayanpal_ · 2026-09-24
- Amazon 论文:高斯过程智能分配重排预算,RAG 检索质量提升 5.4 nCG@100 — _reachsumit · 2026-09-24
- 论文:LLM 重排被检索召回封顶,实测打不过简单协同过滤基线 — _reachsumit · 2026-09-24
- 超越单一标量:分发式服务接口让多个任务头复用观看时长分布 — _reachsumit · 2026-09-24
- Meta 实测 Muse Realtime Avatar:盲测偏好胜两大商用数字人系统 — AIatMeta · 2026-09-24
- LLM 荐股评分近于抛硬币,开发者用股价当标签重做新闻筛选器 — Fun_Water2230 · 2026-09-24