NTU与清华推出S-Agent:让AI通过工具调用理解视频3D空间
jiqizhixin · x · 2026-08-05
南洋理工大学(NTU)与清华大学的研究团队提出了 S-Agent,一种通过工具使用来激发空间推理能力的空间智能体。
核心机制:
S-Agent 能够跨视频帧积累证据,将 2D 实体提升至 3D 场景坐标系中,从而构建自我中心视角并解析方向。
性能表现:
- 在零样本(Zero-Shot)测试中,S-Agent 使 Gemini 3 Pro 的成绩提升了 1.2%,并在 MMSI-Bench 和 ViewSpatial-Bench 上排名第一。
- 通过微调(SFT),蒸馏出的 S-Agent-8B 模型使 Qwen3-VL-8B 的性能提升了 10.5%,其表现可与 GPT-5.4 和 Gemini 3 媲美。
「研究」频道最新
- 伯克利提出「潜在阅读」:用单文本训练模型探索文学 — begusgasper · 2026-08-05
- 独立训练的模型也会长出“通用”注意力头?新研究揭示神经元可预测演化 — CSProfKGD · 2026-08-05
- Connito 推出去中心化 MoE 训练网络,分布式专攻子网络 — shibshib89 · 2026-08-05
- 用科技改善动物福利:高光谱成像与电子束疫苗的家禽应用 — NikoMcCarty · 2026-08-05
- 前 Citadel 量化研究员发布 AI 时代电力定价深度指南 — PandaAshwinee · 2026-08-05
- 微软联合开发病理学大模型 PRISM2 登上 Nature — anshulkundaje · 2026-08-05