SceneActBench 评测 VLM Agent 是否能在完整 3D 场景中行动
Yifei Zhao · hf · 2026-07-27
- SceneActBench 是一个面向 3D 场景动作的 benchmark,关注的是能“动手做事”的 VLM agent,而不只是描述图像。
- 作者指出,现有 3D benchmark 大多只评文本回答或单物体操作,因此对完整多对象 3D 场景中的 agent 行动评估不足。
- 这个 benchmark 统一放在一个 agent-environment loop 里,覆盖 5 个任务;输入可以是 PNG 图片、采样视频帧,或附带的 3D assets。
- 最终输出会用隐藏真值和任务特定的几何指标进行评估。
- SceneActBench 共包含 210 个源实例、520 个任务 case;在 11 个商业 VLM 上的总体分数只有 38.6–50.2,而且没有任何模型能在所有任务上都稳定表现出色。
「应用」频道最新
- Skywork Video 强调 AI 视频要走向完整制作流程 — Shruti_0810 · 2026-07-27
- Skywork Video 让品牌素材和风格可复用 — Shruti_0810 · 2026-07-27
- 一个小应用让读者直接和“书的意识”对话 — pickover · 2026-07-27
- ChatGPT/Codex 扩展可用一句话配置 Gmail 过滤器 — gabrielchua · 2026-07-27
- 用 Claude Code 做的 LSAT 错题网站,支持题目讨论线程 — Isaiah-Burton · 2026-07-27
- TapNow 用 CreativeOS 跑通深圳 AI 恐怖片黑客松 — 葬AI · 2026-07-27