PROWBench:170 个可编程场景检验视频世界模型是否真按程序渲染

AlayaLab · hf · 2026-10-02

AlayaLab 发布 PROWBench,评估可编程世界模型(programmable world models)的视觉生成是否忠实于程序规定的规则与交互。现有基准多测视觉质量、可控性或指令/物理遵循,很少检验对细粒度程序化世界事件的保真度。PROWBench 包含 170 个程序化构造的 episode 和 600 个代理视频,记录实体状态与带时间戳的事件(含镜头外事件)作为可回放的世界记录,可从记录渲染同步视图和粗 3D、包围框等代理表示,从而将生成视频与程序执行的可观测后果对照。基准覆盖第一/第三人称及部分多视角同步观测,用两个 VLM 指标评测实体控制、长程记忆、Logic-Render Alignment 与交互成功率。可作为下一代游戏引擎基础的评估工具。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →