北大联袂可灵团队发布MAVIN,攻克多镜头视频生成叙事难题
机器之心 · wechat · 2026-08-28
北京大学联合可灵团队等提出MAVIN模型,旨在解决现有视频生成模型在处理多镜头、多角色叙事时的时间错位和身份混淆问题。该模型采用边界感知注意力和身份感知传播机制,通过结构化脚本统一调度画面、对白与角色身份,确保镜头切换、口型同步及角色一致性。此外,团队构建了包含多级标注的数据集MAVINSet。实验表明,MAVIN在13项指标上表现最佳,支持叙事节奏控制和角色身份定制,为影视预演和短剧创作提供了新路径。
「多模态」频道最新
- Krea AI 发布新一代模型 Krea Three — chrisfirst · 2026-08-28
- Midjourney 启动 V8.2 编辑模型测试:支持指令与图像控制 — DavidSHolz · 2026-08-28
- Google DeepMind 发布 360° 视频 SfM 评测基准 ORBIT++ — taiyasaki · 2026-08-28
- MiniMax H3 纯文生视频实测:附完整分镜+音效提示词 — BitterAd8431 · 2026-08-28
- Midjourney V8.2 编辑模型上线测,支持笔刷重绘与图生图 — DavidSHolz · 2026-08-28
- Comfy 成为 MiniMax 模型官方商业授权经销商 — crystal_alpine · 2026-08-28