北大与快手 Kling 推出 MAVIN,多镜头音视频生成入 ECCV 2026 Oral
jiqizhixin · x · 2026-09-06
北京大学、快手 Kling、中科院自动化所与中山大学联合推出 MAVIN,一个带定制叙事控制的多镜头音视频生成模型,被 ECCV 2026 接收为 Oral。
它针对 AI 视频生成的三大痛点:
- 时间错位:谁在什么时候说话,避免切镜时声音串到下一个镜头
- 身份混淆:跨镜头保持人脸与音色一致,为每个角色建立独立的视觉与语音锚点
- 输入不完整:用户只给故事大纲,模型将其转化为可执行的分镜脚本
模型在生成镜头时遵循未来镜头描述且不产生语义泄漏。结果:镜头切换准确率(STA)达到 0.98。
「多模态」频道最新
- 扩散语言模型LLaDA推出图像编辑新模型待实测 — Slight_Tone_2188 · 2026-09-06
- 5060 Ti 实测图像工作流:29秒出图并手动清理 — thatguyjames_uk · 2026-09-06
- Midjourney 实战技巧:抹掉面部细节,用剪影撑起卡通情绪 — tisch_eins · 2026-09-06
- 超现实 AI 视频:盐滩脚印下藏着微型火车站,附完整 prompt — umesh_ai · 2026-09-06
- uncomfymcp:免导出工作流、对话即画图的极简 ComfyUI MCP 服务 — citrainmyhefeweizen · 2026-09-06
- Kyutai 音转 MIDI 工具 MuScriptor 输出干净,但许可证疑禁商用 — LumenLime · 2026-09-06