NVIDIA 实习团队发布 SpatialClaw,用代码接口增强 VLM 空间推理

NVIDIA 实习团队在 arXiv 发表 SpatialClaw 论文,研究视觉语言模型(VLM)的智能体空间推理。针对现有空间智能体要么在看到中间结果前就锁定动作、要么缺乏灵活性的问题,该工作提出以代码为动作接口的思路,让 VLM 更灵活地完成 3D/4D 空间推理任务。作者补充称这项研究由 Seokju Cho 在 NVIDIA 实习期间主导,合作者包括 Ryo Hachiuma、Abhishek 等人。

2026-09-29 ~ 2026-09-29 · 2 条相关