PROWBench:170 个可编程场景检验视频世界模型是否真按程序渲染
AlayaLab · hf · 2026-10-02
AlayaLab 发布 PROWBench,评估可编程世界模型(programmable world models)的视觉生成是否忠实于程序规定的规则与交互。现有基准多测视觉质量、可控性或指令/物理遵循,很少检验对细粒度程序化世界事件的保真度。PROWBench 包含 170 个程序化构造的 episode 和 600 个代理视频,记录实体状态与带时间戳的事件(含镜头外事件)作为可回放的世界记录,可从记录渲染同步视图和粗 3D、包围框等代理表示,从而将生成视频与程序执行的可观测后果对照。基准覆盖第一/第三人称及部分多视角同步观测,用两个 VLM 指标评测实体控制、长程记忆、Logic-Render Alignment 与交互成功率。可作为下一代游戏引擎基础的评估工具。
「多模态」频道最新
- 实测:用 Nano Banana 做图像编辑,效果直接看图 — tkasasagi · 2026-10-02
- 博主实测:Opus 5.5 剪视频很强,但无需求硬用产出多垃圾 — AlchainHust · 2026-10-02
- Reddit 用户用 AI 做出以假乱真的概念车动态视频 — Vashukanni · 2026-10-02
- Fable 5.5 曝光:网页能随经过图片的艺术风格实时变形 — lxfater · 2026-10-02
- 牛津 VGG 发布 SynCity 3000:一次生成全局连贯的大规模 3D 场景 — rsasaki0109 · 2026-10-02
- Omni-Embed-Mini:0.9B 参数统一嵌入六种模态且文本检索零退化 — _reachsumit · 2026-10-02