VGI-Bench:探测视频生成模型视觉智能的新基准
_akhaliq · x · 2026-08-28
VGI-Bench 是一个用于评估视频生成模型视觉智能的新基准,包含 27 个任务和 810 个实例,旨在测试模型作为世界动作模型骨干时的推理和行动先验。
- 评估结果:目前最强的模型 Seedance 2.0 仅达到 51.0% 的准确率,显示现有系统在视觉推理任务上仍不可靠。
- 核心发现:模型内部去噪过程显示自我修正能力有限,后期步骤主要细化早期假设而非纠正推理错误。
- 论文:已被 EMNLP'2026 接收。
所属事件:VGI-Bench 发布:视频生成模型视觉推理仍薄弱(3 条相关)→
「多模态」频道最新
- 用 Minimax Grandline LoRA 复刻《摩登时代》黑白影像 — MoonbearAIArt · 2026-09-21
- Qwen 图像编辑现「点状噪点」顽疾,2512 版仍需 50 步缓解 — Druck_Triver · 2026-09-21
- ai-toolkit 已支持 Qwen-Image-2.1 LoRA 训练,HF 上尚无现成模型 — reeight · 2026-09-21
- 用 Seedance 2.5 一段 prompt 生成逼真 3A 风格游戏画面 — SimplyAnnisa · 2026-09-21
- 本地跑 Flux 2 Dev 全攻略:30B 模型配显存方案与模型组合玩法 — Altruistic_Heat_9531 · 2026-09-21
- 阿里 Qwen-Image-2.1 登上 Hugging Face 热门榜 — Qwen · 2026-09-21