SpatialClaw 论文:以代码为动作接口,让 VLM 更灵活地做 3D/4D 空间推理
CMHungSteven · x · 2026-09-29
NVIDIA 实习团队发布的 arXiv 论文 SpatialClaw 研究视觉语言模型(VLM)的智能体空间推理:
- 现有空间智能体要么用单次代码执行(在看到中间结果前就锁定分析策略),要么用结构化工具调用(灵活性不足,难以自由组合操作)。
- SpatialClaw 是免训练框架,采用「代码作为动作接口」:维护一个预载输入帧及感知/几何原语的持久 Python 内核,VLM 智能体每步写一个可执行 cell,可基于所有先前输出组合和调整感知结果,支持开放式 3D/4D 空间推理。
- 作者邀请智能体、机器人、VLM 空间评测方向的开发者复现最新前沿模型成绩。
所属事件:NVIDIA 实习团队发布 SpatialClaw,用代码接口增强 VLM 空间推理(2 条相关)→
「研究」频道最新
- VLANeXt Family:500+ 控制实验提炼 12 条 VLA 模型实用配方 — ccloy · 2026-09-30
- RL with Confidence Margin 论文:让置信度逐步追踪推理正确性 — EliasEskin · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- 南科大 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍 — SouthernUniversityofScienceandTechnology · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30
- 美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36% — meituan · 2026-09-30