GraphVid 用交互图控制视频生成,FID 最多降 39.9%
PLAN-Lab · hf · 2026-07-24
这项工作做了什么
GraphVid 是一个基于图结构条件的图生视频模型,让用户不再只靠文本提示或手动画轨迹,而是通过结构化的交互图来控制多个对象之间的关系和动作。
解决了什么问题
- 传统轨迹式控制在场景复杂、对象重叠时很难精确指定。
- GraphVid 用“语义交互图”作为控制接口,让多主体场景的编辑更灵活,也更容易表达对象之间的关系。
- 论文还构建了 GraphVid-Bench,这是一个面向交互关系的大规模视频数据集,带有结构化关系标注。
实验结果
- 在训练数据更少、可训练参数更少的情况下,GraphVid 仍然给出了较强的可控性和视频质量。
- 相比 Motion-I2V,论文报告 FID 最多下降 39.9%、FVD 下降 37.6%,同时 PSNR 从 9.87 提升到 15.98、SSIM 从 0.38 提升到 0.61。
- 论文认为,结构化语义接口是可控视频生成的一个有前景方向。
「多模态」频道最新
- 新 ComfyUI 节点用上下文锚定分块自动放大图像 — blakeem · 2026-07-24
- Black Forest Labs 视频模型被用于自动化 Audi 制造流程 — hsu_byron · 2026-07-24
- Unlimited-OCR 再登 Hugging Face 热门榜第一 — _akhaliq · 2026-07-24
- ComfyUI 里 LTX 2.3 镜头运动出现严重拖影 — Alarming_Watch9109 · 2026-07-24
- ChatGPT Images 真人照一般,但冷门发型构想仍然最好用 — flowersslop · 2026-07-24
- AI驱动产品宣传片制作:大幅升级动画运镜能力 — AlchainHust · 2026-07-24