MiniMax 0.7 Demo: Lip-Synced Music Video from 5 Reference Photos

EternalDivineSpark · reddit · 2026-09-07

A user demonstrates MiniMax 0.7 (MP, 8 steps) generating a lip-synced music video from 5 reference photos (2 faces, a bike, a dress), then frame-interpolating and upscaling the result, with prompts written via ChatGPT.

Original post →

More from Multimodal

Multimodal channel →