WorldExam 评测视频模型能否生成真正会反应的世界
Yuxue Yang · hf · 2026-08-04
- WorldExam 是一个面向可控视频生成/世界模型的 benchmark,目标不只是看画面好不好,而是看生成的世界会不会合理“反应”。
- 它把评测拆成四层:视觉质量、控制遵循、空间一致性、世界反应性。
- 整个基准包含 1,474 个 case、8 个任务,并兼容 camera / action / language 三种控制范式。
- 对 20 个代表性模型的评测显示出明显分化:
- camera 驱动模型擅长镜头控制,但缺少动态交互;
- action 驱动模型对主体控制更准,但世界常常不“活”;
- language 驱动模型互动性更好,但复杂控制遵循度较弱。
- 结论是:画面质量高、指令完成得表面正确,并不等于它真的具备强世界模型能力。
「多模态」频道最新
- Minimax H3 Omni 用 After Effects 动画做参考控制 — bdsqlsz · 2026-08-04
- 多款 LLM 识别同一飞机和航空公司都翻车 — airbus_a360_when · 2026-08-04
- ChatGPT 现在能画出指定时间的手表 — binary-baba · 2026-08-04
- 3060 12GB 生成 10 秒皮克斯动画花了 13 分钟 — Pitiful_Archer_4381 · 2026-08-04
- MiniMax H3 新图又好笑又有点翻车 — comfyui_user_999 · 2026-08-04
- 有人在找能提速的 MiniMax 工作流 — PersonalMango2562 · 2026-08-04