视频模型视觉推理基准 VGI-Bench:Seedance 暂居首
青稞AI · wechat · 2026-09-01
针对视频生成模型是否具备“通过生成进行视觉推理”的能力,研究团队构建了包含 27 个任务、810 个样本的 VGI-Bench 基准。评测结果显示,模型已具备初步视觉推理能力,但距离稳定可靠仍有差距。
排名前三:Seedance 2.0 (51.0分), MiniMax-H3 (44.4分), Kling 3.0 (44.0分)。
关键发现:
- 视觉外观显著影响模型得分与排名。
- 在大规模合成数据上 Fine-tuning 能明显提升表现,主要源于推理能力增强及动作更温和(违规减少)。
- 内部去噪轨迹分析表明,模型在生成早期即形成解题假设,后期少有自我修正(与扩散语言模型不同)。
- 部分闭源模型的高分可能得益于外部的 VLM Prompt Rewriting,而非模型原生能力;而开源的 MiniMax-H3 逼近 SOTA,表明 Scaling Law 在视频推理中依然有效。
「多模态」频道最新
- 开发者更新实时面部增强应用:面部肌肉动画系统明显改进 — Many-Ad-6225 · 2026-09-03
- FastH3 开放 API:720p 实时流式视频+同步音频,超实时速度且出奇便宜 — boudaboy · 2026-09-03
- 多款 AI 检测器判一首歌 80% 为 AI,博主难以置信 — BountyKraken · 2026-09-03
- 用 Imagine agent 逐镜生成+网格拼贴,调色实验工作流分享 — Kyrannio · 2026-09-03
- Video Delta Net 让开源视频生成提速 75–90 倍,14 秒视频 11 秒生成 — xiuyu_l · 2026-09-03
- Vine 复活:用 fal H3 Max Turbo 生成的无限滑动短视频流 — chrisfirst · 2026-09-03