北大与快手 Kling 推出 MAVIN,多镜头音视频生成入 ECCV 2026 Oral

jiqizhixin · x · 2026-09-06

北京大学、快手 Kling、中科院自动化所与中山大学联合推出 MAVIN,一个带定制叙事控制的多镜头音视频生成模型,被 ECCV 2026 接收为 Oral。

它针对 AI 视频生成的三大痛点:

模型在生成镜头时遵循未来镜头描述且不产生语义泄漏。结果:镜头切换准确率(STA)达到 0.98。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →