北大联袂可灵团队发布MAVIN,攻克多镜头视频生成叙事难题

机器之心 · wechat · 2026-08-28

北京大学联合可灵团队等提出MAVIN模型,旨在解决现有视频生成模型在处理多镜头、多角色叙事时的时间错位和身份混淆问题。该模型采用边界感知注意力和身份感知传播机制,通过结构化脚本统一调度画面、对白与角色身份,确保镜头切换、口型同步及角色一致性。此外,团队构建了包含多级标注的数据集MAVINSet。实验表明,MAVIN在13项指标上表现最佳,支持叙事节奏控制和角色身份定制,为影视预演和短剧创作提供了新路径。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →