S-Agent 用行动链做空间推理,MMSI-Bench 零样本达 46.4%
机器之心 · wechat · 2026-07-24
南洋理工大学 S-Lab 联合 Ropedia 提出 S-Agent,把空间理解从“一次性回答”改成“可执行的行动链”。
核心思路
- VLM 负责理解任务与规划下一步,例如识别问题在问什么、该先看哪个实体、下一步要调用什么工具。
- 几何/三维相关工作交给专用模型,比如深度、位姿、3D 对齐等由 DA3 一类工具完成。
- 系统按三层组织工具:
- 2D 感知:选关键帧、定位实体、补齐目标;
- 3D 对齐:把多视角信息对到统一坐标系;
- 空间专家:把原始几何输出转成“右后方”“距离更近”等可直接用的证据。
结果
- 在 MMSI-Bench 上,S-Agent zero-shot 达到 46.4%,高于 Gemini 3 Pro 的 45.2% 和 GPT-5.4 的 41.9%。
- 在 ViewSpatial-Bench 上达到 60.0%。
- 通过 S-300K 轨迹蒸馏,8B 模型进一步提升到 41.6 / 46.8(MMSI / ViewSpatial)。
作者的结论
这项工作想强调的不是“更大模型”,而是更会行动的系统:
- 先发现证据缺口;
- 再调用合适工具;
- 把每一步的结果写入记忆;
- 最后把成功的行动轨迹蒸馏回小模型。
它对应的应用场景包括机器人导航、AR/VR 空间助手、长视频问答和自动驾驶场景理解等。
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11