GraphVid 用交互图控制视频生成,FID 最多降 39.9%
PLAN-Lab · hf · 2026-07-24
这项工作做了什么
GraphVid 是一个基于图结构条件的图生视频模型,让用户不再只靠文本提示或手动画轨迹,而是通过结构化的交互图来控制多个对象之间的关系和动作。
解决了什么问题
- 传统轨迹式控制在场景复杂、对象重叠时很难精确指定。
- GraphVid 用“语义交互图”作为控制接口,让多主体场景的编辑更灵活,也更容易表达对象之间的关系。
- 论文还构建了 GraphVid-Bench,这是一个面向交互关系的大规模视频数据集,带有结构化关系标注。
实验结果
- 在训练数据更少、可训练参数更少的情况下,GraphVid 仍然给出了较强的可控性和视频质量。
- 相比 Motion-I2V,论文报告 FID 最多下降 39.9%、FVD 下降 37.6%,同时 PSNR 从 9.87 提升到 15.98、SSIM 从 0.38 提升到 0.61。
- 论文认为,结构化语义接口是可控视频生成的一个有前景方向。
「多模态」频道最新
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11