MLLM-Guided Semantic Correction for Text-to-Video Generation

kwangmoo_yi · x · 2026-08-19

This paper introduces a training-free, interpretable mid-generation correction framework. By integrating multimodal large language model (MLLM) feedback directly into the diffusion sampling loop, it uses MLLMs to check denoising previews for semantic evaluation and injects corrective prompts. The method includes a Semantic Assessment Supervisor and a Semantic Modification Assistant, improving semantic alignment, visual fidelity, and temporal consistency without modifying model parameters.

Original post →

More from Multimodal

Multimodal channel →