S-Agent 用行动链做空间推理,MMSI-Bench 零样本达 46.4%
机器之心 · wechat · 2026-07-24
南洋理工大学 S-Lab 联合 Ropedia 提出 S-Agent,把空间理解从“一次性回答”改成“可执行的行动链”。
核心思路
- VLM 负责理解任务与规划下一步,例如识别问题在问什么、该先看哪个实体、下一步要调用什么工具。
- 几何/三维相关工作交给专用模型,比如深度、位姿、3D 对齐等由 DA3 一类工具完成。
- 系统按三层组织工具:
- 2D 感知:选关键帧、定位实体、补齐目标;
- 3D 对齐:把多视角信息对到统一坐标系;
- 空间专家:把原始几何输出转成“右后方”“距离更近”等可直接用的证据。
结果
- 在 MMSI-Bench 上,S-Agent zero-shot 达到 46.4%,高于 Gemini 3 Pro 的 45.2% 和 GPT-5.4 的 41.9%。
- 在 ViewSpatial-Bench 上达到 60.0%。
- 通过 S-300K 轨迹蒸馏,8B 模型进一步提升到 41.6 / 46.8(MMSI / ViewSpatial)。
作者的结论
这项工作想强调的不是“更大模型”,而是更会行动的系统:
- 先发现证据缺口;
- 再调用合适工具;
- 把每一步的结果写入记忆;
- 最后把成功的行动轨迹蒸馏回小模型。
它对应的应用场景包括机器人导航、AR/VR 空间助手、长视频问答和自动驾驶场景理解等。
「多模态」频道最新
- Physics-IQ 审计发现,歧义提示和伪影会重排视频模型排名 — DynamicWebPaige · 2026-07-25
- 一条可直接复用的 Q 版 3D 角色提示词 — cocktailpeanut · 2026-07-25
- AI 生成的 Q 版娃娃像一套收藏角色图 — aziz4ai · 2026-07-25
- AI 把《Baki》做成了真人化风格演示 — aitrendz_xyz · 2026-07-25
- 微软把 MAI-Image-2.5-Flash 设为 Bing Image Creator 默认模型 — JordiRib1 · 2026-07-25
- AI 动画对战视频把秋日决斗做成 4K 少年漫 — TurnFlat2876 · 2026-07-25